開発者ツール

AI

Agentjacking:AIコーディングエージェントをSentryで乗っ取る新手法

Sentryのエラー追跡機能を悪用してAIコーディングエージェントに任意コードを実行させる攻撃「Agentjacking」が公開されました。Claude Code・Cursor・Codexで成功率85%、2,388組織が対象で、事前侵害なしに攻撃が成立します。
AI

LedgerAgent:AIのポリシー違反ツール呼び出しを台帳で遮断

arXiv論文(2606.20529)がLLMエージェントのツール呼び出し前にポリシー違反を検出・遮断するLedgerAgentを提案しました。タスク状態を専用台帳で管理してプロンプトと分離し、4ドメインの評価で従来手法より高い一貫性指標を達成しています。
AI

マウスと視線でLLMを改善 — 暗黙的フィードバックによるアライメント手法

マウス軌跡と視線データを使ってユーザーの好みを暗黙的に推定し、LLMアライメントを改善するIFLLM手法が発表されました。59人から収集した1,336件のデータで報酬モデルの精度が55%から64%へ改善し、DPO適用時の品質改善量がテキストのみの約3倍になっています。
AI

VISUALSKILL:視覚スキルでPC操作エージェント精度+15pt

MITなどの研究者がPC操作エージェント向けのマルチモーダルスキルライブラリVISUALSKILLを発表しました。テキストだけでなくUI図・スクリーンショットも保持する設計で、ベースラインから+15.3ポイントの精度向上を達成しています。MCPツールとして実装済みで組み込みやすい構成です。
AI

XDOF、7000万ドル調達 — ロボット訓練データの専門企業が始動

ロボットAIの訓練データ収集を専業とするXDOFがa16z・Thrive Capitalなどから7000万ドルを調達しました。テキストデータがLLMを支えたように、物理操作データがロボット工学の次のボトルネックと位置づけられています。
AI

Gemma 4 12B公開 — 音声対応・エンコーダ不要のオープンマルチモーダルモデル

GoogleがオープンソースモデルGemma 4 12Bを公開しました。エンコーダ不要の設計で音声・画像・テキストをネイティブに処理でき、16GBのVRAMで動作するためラップトップへの展開が可能です。Apache 2.0ライセンスで商用利用も許可されています。
AI

NewCore、$66M調達 — AIエージェントのID管理に特化

AIエージェントが企業の「従業員」として動く時代を見据え、ID管理・セキュリティに特化したNewCoreが$66M(バリュエーション$300M)を調達しました。McKinseyでは既に2.5万のAIエージェントが稼働しており、既存のIAMシステムでは対応できない課題に取り組みます。
AI

EvoArena論文:動的環境でLLMエージェントメモリを進化

EvoArena(arXiv:2606.13681)は変化する環境でLLMエージェントを評価するベンチマーク群で、既存エージェントの平均精度が39.6%にとどまることを明らかにしました。パッチベースのEvoMemメモリはGAIAで+6.1%を達成し、動的環境対応の設計指針を提供しています。
AI

HyperTool論文:ツール呼び出し並列化でエージェント精度2倍に

arXiv論文(2606.13663)が提案するHyperToolは、エージェントが複数ツールを1ブロックで並列実行できるインターフェースです。MCP-Universeベンチマークでは同一モデルの精度が2倍以上になり、ツール実行設計の重要性を実証しています。
AI

Kimi K2.7-Code公開 — 1兆パラメータOSSがMCPMarkでOpus超え

Moonshot AIが1兆パラメータのコーディング特化OSSモデル「Kimi K2.7-Code」を公開しました。MCPMark VerifiedでClaude Opus 4.8(76.4%)を上回る81.1%を記録し、Modified MITライセンスでHugging FaceとAPIから利用できます。