ビジネス応用重要度 ★8
Nemotronにギリシャ語を教える:コーパスの採掘、検索の適応、専門領域にわたる現代ギリシャ語の生成のグラウンディング
Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains
https://export.arxiv.org/api/query·2026/8/5
AI要約
Nemotronモデルを現代ギリシャ語に適応させる手法です。分野特化型RAG(Retrieval-Augmented Generation)の改善を目指し、新しいベンチマークも提案されています。
AI要点
- Nemotronモデルと主要な多言語検索ベンチマークには現代ギリシャ語が欠けているが、法律、エネルギー、金融、医療分野で重要である。
- Nemotron検索スタックを現代ギリシャ語に対応させるため、コーパス採掘、合成監視、検索モデルトレーニング、リランカー適応、リーダーファインチューニングをエンドツーエンドで実施した。
- BM25ベースラインは、専門ギリシャ語コーパスにおいて、いくつかの既存の多言語密検索モデルよりも優れていることが示された。
- Nemotron 1B埋め込みモデルをファインチューニングすることで、nDCG@10が0.362から0.835に向上し、未適応のモデルを大幅に上回った。
- 開発したNemotron 30B-A3Bモデルは、回答の正答率を29.4%から66.9%に向上させ、関連性と引用の質を改善した。
なぜ重要か
本研究は、現代ギリシャ語における検索拡張生成(RAG)の能力を大幅に向上させ、専門分野における情報アクセスと知識抽出の改善に貢献する新たなリソースとモデルを提供する。