直近2日間のAI関連ニュースから厳選。特集3本 + 全記事ダイジェスト(重要度降順)。
コーディングエージェントの世界では「モデル単体ではなく、その周りのハーネス(足場)が成果を決める」というパラダイムが定着した。この論文は、そのパラダイムをロボットのような物理世界で動くエージェントに拡張できるかを問う。提案する Thea は、ロボットの各機能を「呼び出し可能なツール」としてラップし、エージェントループで統括するハーネス。ソフトウェアが無償で提供してくれる「世界の状態を読む」「行動の結果を判定する」という2つの能力を物理世界は与えてくれないため、Thea は「Scene Graph as Context」(永続的でシンボリックな世界表現)と「Evaluation as Exit Codes」(行動の終了判定・成否判定・失敗時の原因診断)という2つの仕組みでこのギャップを埋める。
Anthropicは2026年8月2日以降にリリースしたClaudeモデルの全テキスト出力に、目に見えない透かし(コピペしても残る)を組み込み始めた。画像ファイル(PNG/JPG/SVG)にはC2PA署名付きの出自メタデータも付与。狙いはEU AI Act第50条2項の「AI生成コンテンツの透明性に関する行動規範」対応で、OpenAI・Google・Meta・Microsoft・Mistralなども同規範に署名済みだが、Anthropicはテキストへの明確な対応を最初に世界展開した企業になった。Reddit上では「軽い添削やジャーナリストの要約作業まで透かしが付く」という反発と、「AI生成物の検出は良いことだ」という支持が併存している。
金融機関が意思決定をエージェントAIに委ねる動きが進む中、この論文は「Verifiability Gap(検証可能性ギャップ)」という概念を提示する。委任された権限が要求する検証水準と、決定後に残る説明可能性・再現性との落差のことだ。30億パラメータのローカルモデルから商用フロンティアモデルまで9つのモデルバージョンで3つの実験を実施したところ、フロンティアモデルはtemperatureやシード値の固定を拒否し、再現性はローカルモデルの320/320に対し商用モデルは319/320・959/960と、能力の高さは「再現しやすさ」とは無関係だと判明。オーケストレーション層(複数モデル・ツールの統括構成)の変更だけでも、どの設定でも一度も同じ実行記録が再現しないことも示された。