ITmedia AI+
元記事公開:

「1週間の開発タスク」でAIの限界を検証 Googleが「Android Bench 2.0」公開

AI要約

GoogleがAIモデルやエージェントのコーディング能力を測る「Android Bench 2.0」を公開し、複雑な長期タスクでの性能低下を検証した

重要ポイント

  • •「Android Bench 2.0」は、エンジニアが数日を要する複雑な長期タスクを課す仕様へと刷新された
  • •新しい基準での最高通過率は、従来の約91%から約28%に急落した
  • •このベンチマークにより、AIモデルやエージェントが長期的・複雑な開発タスクに対応する際の限界が浮き彫りになった
もっと見る