AI News Digest

2026年8月25日 朝刊

Today's Features

1. 複数エージェントで推論を分担する「Two Heads are Better Than One」

大規模言語モデルの推論力を伸ばすテストタイムスケーリングを、1体のエージェントではなく複数エージェントの協調で行う手法を提案する論文。DeepSeek-R1で作った500件の協調推論データセット「M500」で学習させ、「CEOエージェント」が協調の深さを動的に調整する仕組みも導入。ファインチューニングしたQwen2.5-32B-MASとPhi4-14B-MASは元モデルを大きく上回る性能を達成した。

arXiv:2504.09772 →

2. パキスタン発、低コストAIロボット教育の実践

2026年7月、FIRST GlobalとExperiential AIが190か国以上のロボット教育にアジェンティックAIを導入。パキスタンのLearnOBotsは1人あたり15〜50ドルという低コストで、ESP32や3Dプリント部品、オフラインで動く小型言語モデルを使い、現地の環境に合わせたロボット教育を続けてきた。予算の制約が、むしろ実用的な工夫を生み出す好例として紹介されている。

Dev.to →

3. 報酬モデルを自動生成する「AIRL-S」

強化学習によるテストタイムスケーリングとプロセス報酬モデルによる探索、それぞれの弱点を解決するため、敵対的逆強化学習(AIRL)とGRPOを組み合わせた統一フレームワーク。正解の軌跡だけからステップごとの密な報酬モデルを推定でき、数学・科学・コード生成の8ベンチマークで平均9%の性能改善、GPT-4o相当の水準に達した。

arXiv:2508.14313 →

Digest(importance順)