LLM推論初出 5/24 15:35
MaxTextがポストトレーニング機能を拡張:シングルホストTPU上でのSFTとRLの導入
MaxText Expands Post-Training Capabilities: Introducing SFT and RL on Single-Host TPUs
https://developers.googleblog.com/feed2026/5/24
AI要約
MaxTextは、単一ホストTPU構成でのSFT(Supervised Fine-Tuning)とRL(Reinforcement Learning)のサポートを拡張。JAXとTunixライブラリを活用し、事前学習済みモデルの適応と複雑な推論のための効率的なアルゴリズムを提供する。