AI

謎のステルスモデルOx Alpha、正体はZhipuかMAIか

OpenRouterに8月20日、開発元を明かさない推論モデルOx Alphaが登場しました。Zhipu AI説とMicrosoft MAI説が対立し、Stripe CEOも「印象的」と言及しています。
AI

AgenticRAG-FP、多段階RAGの障害特定で精度ゼロに

新ベンチマークAgenticRAG-FPは、多段階検索の誤り特定精度が後段になるほど低下すると実証しました。Claude Haiku 4.5を使った検証では1段階目は91%、2段階目以降は0%まで落ち込んでいます。
AI

AI企業5社調査、暴走モデル封じ込め計画は未公表 米で規制強化へ

AI標準化団体Guidelightの調査で、Anthropic・OpenAIなど主要AI企業5社の大半が、モデル暴走時の封じ込め計画を公表していないことが判明しました。米カリフォルニア州などでは規制の動きも強まっています。
AI

AI学習は合法か、Anthropic15億ドル和解の意味

AIモデルを著作物で学習させる合法性をめぐり、米国の司法判断が分かれています。Anthropicの15億ドル和解は学習行為でなく、違法な海賊版サイトからの書籍入手への処罰だと判事は説明し、市場競合の有無が判断を左右しています。
AI

MidTool、Qwen3のツール呼び出し精度を中間学習で強化

研究チームがMidToolという中間学習データ構築パイプラインを提案しました。実在するツールAPIやMCPのスキルを合成データに組み込み、Qwen3で学習した結果、BFCLなど3つのベンチマーク全てで性能が向上しています。
AI

Inherent、270億パラメータのFaradayが論文再現で首位

DeepMind出身者が創業した英AIラボInherentは、270億パラメータの小型オープンモデルで動くAIエージェントFaradayが、科学論文の再現実験でAnthropicとOpenAIのフロンティアモデルを上回ったと発表しました。
AI

LLM自己改善、論文『Phantom Gains』が測定誤差指摘

Cheng Xu氏らの研究チームが、LLMエージェントの自己改善報告の多くを測定方法の欠陥による見かけの改善だと実証しました。未訓練モデルにも0.280の改善率が出る指標もあり、有効性が確認されたのは外部蒸留のみでした。
AI

生成AI利用で宿題18%上昇、試験は最大24%低下 2.7万人調査

中国の生徒27,000人を30ヶ月間追跡した調査で、生成AI利用は宿題の点数を18%押し上げる一方、試験の点数は最大24%下げることが分かりました。低下はAIを答えの近道として使った生徒に集中しています。
AI

UberにGDPR制裁金8.25億ユーロ、AIがドライバー停止

オランダのデータ保護当局はUberに対し、アルゴリズムによるドライバーの口座自動停止がGDPR違反にあたるとして8億2500万ユーロの制裁金を科しました。GDPR史上、Metaに次ぐ2番目の高額処分です。
AI

OpenAI、GPT-5.6 Solを20%超値下げ Opus超え

OpenAIはGPT-5.6 SolのAPI価格を今後3カ月間20%超値下げしました。入力は100万トークン5ドルから4ドルへ、出力は30ドルから20ドルへ下がり、Claude Opus 5より安価になりました。