大規模言語モデルの推論力を伸ばすテストタイムスケーリングを、1体のエージェントではなく複数エージェントの協調で行う手法を提案する論文。DeepSeek-R1で作った500件の協調推論データセット「M500」で学習させ、「CEOエージェント」が協調の深さを動的に調整する仕組みも導入。ファインチューニングしたQwen2.5-32B-MASとPhi4-14B-MASは元モデルを大きく上回る性能を達成した。
2026年7月、FIRST GlobalとExperiential AIが190か国以上のロボット教育にアジェンティックAIを導入。パキスタンのLearnOBotsは1人あたり15〜50ドルという低コストで、ESP32や3Dプリント部品、オフラインで動く小型言語モデルを使い、現地の環境に合わせたロボット教育を続けてきた。予算の制約が、むしろ実用的な工夫を生み出す好例として紹介されている。
強化学習によるテストタイムスケーリングとプロセス報酬モデルによる探索、それぞれの弱点を解決するため、敵対的逆強化学習(AIRL)とGRPOを組み合わせた統一フレームワーク。正解の軌跡だけからステップごとの密な報酬モデルを推定でき、数学・科学・コード生成の8ベンチマークで平均9%の性能改善、GPT-4o相当の水準に達した。