Платим блогерам
Блоги
kosmos_news

Текст опубликован в личном блоге и его автор не имеет отношения к администрации сайта

Новый бенчмарк предназначен для проверки возможностей разработки под Android.
реклама

Google представила новый бенчмарк. Android Bench 2.0 проверяет, насколько хорошо ведущие модели ИИ справляются со сложными задачами разработки под Android, на выполнение которых у разработчиков-людей ушло бы несколько дней. Эти задачи включают добавление важных функций и создание новых приложений для Android. Google уже протестировала несколько своих последних моделей ИИ с помощью нового бенчмарка.Изображение: нейросеть qwen

В начале этого года Google выпустила первую версию Android Bench, а теперь представила и обновление. Android Bench 2.0 оценивает модели и агентов на основе более сложных задач, призванных лучше отражать реальную разработку программного обеспечения. Одна из наиболее значительных новых функций — это введение задач с долгосрочным горизонтом. Это значительно более сложные задачи разработки, выполнение которых заняло бы у разработчиков-людей несколько дней.

По словам Google, первая версия Android Bench, как и многие другие ранние тесты программирования ИИ, в основном фокусировалась на незначительных изменениях. Android Bench 2.0 стремится поднять планку еще выше.

реклама

Кроме того, Google изменила методологию оценки: вместо того, чтобы полагаться исключительно на бинарную систему, Android Bench 2.0 использует непрерывную оценку. По словам Google, это дает более осмысленную картину того, насколько хорошо модель справилась с задачей, даже если она не смогла полностью ее выполнить.

Google уже протестировал несколько новейших моделей ИИ с помощью Android Bench 2.0, включая Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol и Claude Opus 5. Модель GPT-6 Astra, разработанная OpenAI, показала 28-процентный результат, став лучшей в рейтинге. Claude Fable 5.1 от Anthropic заняла второе место с 22,7%.

Собственные модели Google значительно отстают от конкурентов. Gemini 3.8 Flash показала лучшие результаты в тесте, но достигла лишь восьми процентов. Китайские модели Qwen 3.8 Max и Kimi K3 набрали 14 и 12 процентов баллов соответственно, что ставит их в середину списка из одиннадцати протестированных моделей.

Источник: developer.android.com
Теперь в новом формате

Наш Telegram-канал @overclockers_news
Подписывайся, чтобы быть в курсе всех новостей!

Популярные новости