Googleは新たにAndroid Bench 2.0を公開し、AIモデルの複雑で長期的なコーディング能力を評価できるベンチマークを提供しました。
ITmedia AI+によると、このベンチマークは数日間にわたる高度なタスクを課すもので、従来の約91%だった最高合格率が約28%に大幅に低下しました。これにより、AIのコーディング能力の実態がより厳密に測定されることになります。
日本の市場でもAI技術の活用が進む中、こうした詳細な評価基準の登場は、AI開発の品質向上や投資判断に重要な指標となるでしょう。
