LLM推論初出 8/6 02:58
OctoLong:トレーニング中のクロスリポジトリコードコンテキストが長コンテキストモデリングを強化
OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling
https://export.arxiv.org/api/query·2026/8/5
AI要約
OctoLongは、コードコンテキストを横断的に利用し、長文脈モデリングを強化する手法です。既存の長文脈コーパスの限界を克服します。
AI要点
- OctoLongは、数百万トークンに及ぶ依存関係の豊富なコードコンテキストをキュレーションするためのコンテキストエンジニアリングパイプラインである。
- このパイプラインは、ASTパーサー、言語サーバーバックエンド、パッケージマネージャーを活用して、コード参照を再帰的に取得する。
- OctoLong-Instructは、6億から140億パラメータのベースモデルから派生した、長コンテキスト対応のオープンLLMのスイートである。
- 約500億トークンのデータセット(OctoLongコードコンテキスト約62億トークンを含む)で、コンテキスト拡張ミッドトレーニングを実施した。
- 従来のコンテキスト拡張データセットの一部をOctoLongデータに置き換えることで、長距離検索、長期状態追跡、リポジトリレベルのコード理解が大幅に向上した。
なぜ重要か
OctoLongは、コードリポジトリ間の広範なコンテキストを効果的に活用することで、長コンテキストモデリングの能力を強化し、コード生成、エージェントワークフロー、およびソフトウェア開発におけるLLMの応用範囲を拡大する。