RRSIはAIエージェントの自己改良で「試験の丸暗記」を防ぐ手法、Google Researchが論文とコード公開
Google Researchの研究者が、AIエージェントの指示文や手順を自動で改良するときに起きる「評価用の課題への過剰適合」を抑える手法RRSIを発表した。未知のベンチマークで最大4.7ポイント改善し、改良後の実行トークンは正則化なしより約30%少ない。
出典:arXiv・GitHub google-research・The Decoder
論文に関する海外の最新ニュース5本を日本語でまとめています。公式発表・論文・海外メディアの報道をもとに、ビジネスへの影響まで解説します。
Google Researchの研究者が、AIエージェントの指示文や手順を自動で改良するときに起きる「評価用の課題への過剰適合」を抑える手法RRSIを発表した。未知のベンチマークで最大4.7ポイント改善し、改良後の実行トークンは正則化なしより約30%少ない。
出典:arXiv・GitHub google-research・The Decoder
ハーバード大の物理学者マシュー・シュワルツ教授が、Claudeに精密な科学計算をさせるOSS「BootLoops」を公開した。Claude Codeを並行で動かし、3カ月で18分野・36本の論文原稿をまとめた。AIの弱点と付き合い方も具体的に記している。
出典:Anthropic(Matthew Schwartz氏の寄稿)・GitHub BootLoops-ai・X @AnthropicAI
スペインのIMDEA Networksなどの研究者が、ChatGPT、Claude、Grokなど9つのAIチャットの通信を調べた。Web版9つのうち6つで、会話のURLや自動で付く題名、入力文が広告・計測企業に送られていた。
出典:Oliveira ほか(IMDEA Networks など)・LeakyLM(研究チームのサイト)・スペインデータ保護庁(AEPD)
Google Researchは画像生成AIの調整手法を一つの数理の枠組みにまとめるDiffusion Controllerを解説した。本体を固定したまま約1,200万パラメータの部品を足し、2つの学習方式で人の好みの指標がLoRAを上回った。
出典:Google Research Blog・arXiv(Tong Yang ほか)・arXiv
Google DeepMindがAIで設計したタンパク質に電子透かしを埋め込むSynthID Bioを発表した。3種類の標的でのウェット実験で結合力を落とさず、論文はNatureに掲載。コードと重みは研究者向けに公開する。
出典:Google DeepMind・Google・Nature