Google DeepMind, дочерняя компания интернет-гиганта, занимающаяся искусственным интеллектом, 11 декабря представила последнюю версию своей серии моделей искусственного интеллекта: Gemini 2.0 или первую модель из серии Gemini 2.0 Flash. Модель основана на своей предшественнице 1.5 Flash и обещает улучшенную производительность при неизменно быстром времени отклика. Примечательно, что 2.0 Flash превосходит своего предшественника 1.5 Pro в важных тестах — реагирует на запросы вдвое быстрее.
Фото: Google Центральным нововведением является расширенная мультимодальность системы. Помимо обработки изображений, видео и аудио, модель теперь также может самостоятельно генерировать изображения и комбинировать их с текстом.
Кроме того, ИИ имеет многоязычные возможности преобразования текста в речь и может вызывать собственные инструменты, такие как поиск Google, а также пользовательские функции. Чат-бот Gemini, конечно же, также должен получить обновление. Gemini 2.0 должен иметь возможность обрабатывать до одного миллиона входных токенов, выход ограничен 8 тысячами токенов.
Пока неизвестно, в какой степени Gemini сможет конкурировать с другими моделями ИИ, такими как модели OpenAI или Anthropic. На данный момент опубликованы только тесты производительности по сравнению с предшествующими моделями Gemini 1.5 Flash и Gemini 1.5 Pro — и, конечно же, они уступают версии 2.0. Google, вероятно, хочет конкурировать с OpenAI и Anthropic с помощью Gemini 2.0 Pro в начале 2025 года.
«Достижения Gemini 2.0 основаны на десятилетиях инвестиций в наш дифференцированный, комплексный подход к инновациям в области искусственного интеллекта. ИИ создан на специальном оборудовании, таком как Trillium, наши TPU шестого поколения. TPU обеспечивают 100% обучения и вывода контента Gemini 2.0, и сегодня Trillium, как правило, доступен для клиентов», — заявил генеральный директор Google Сундар Пичаи в пресс-релизе.
В течение последних нескольких месяцев разработчики тестировали экспериментальные версии Gemini 2.0 с избранными пользователями и получили ценные отзывы. Модель теперь доступна разработчикам через Gemini API в Google AI Studio и Vertex AI, хотя некоторые функции первоначально будут доступны только избранным партнерам. Доступ для всех станет возможным в январе.
Для поддержки разработчиков также представлен новый Multimodal Live API. Это решение позволяет в реальном времени вводить потоковое аудио и видео, а также комбинировать различные инструменты. Чего не хватает в Gemini 2.0, так это генерации видео — то есть того, что OpenAI 9 декабря вывела на рынок с помощью ИИ-инструмента Sora.
Параллельно с версией для разработчиков в приложении Gemini будет развернута версия 2.0 Flash, оптимизированная для чата. Пользователи по всему миру могут получить доступ к этой экспериментальной версии сначала через настольную и мобильную веб-версии, а затем и через мобильное приложение. Gemini 2.0 будет интегрирован в другие продукты Google в начале следующего года.
Gemini 2.0 также поставляется в ИИ-сервис Gemini Advanced в виде новой функции Deep Research. Система сочетает в себе опыт поиска Google с аналитическими возможностями искусственного интеллекта для исследования и подготовки сложных тем. Deep Research использует агентскую систему для поиска информации в интернете. Найденные данные обрабатываются с помощью контекстного окна 1M Token и обобщаются в виде структурированного отчета.
Эта функция предназначена для того, чтобы пользователи могли быстро получить обзор более сложных тем. Система предназначена для представления результатов исследования в понятной форме. Эта новая функция теперь доступна для пользователей Gemini Advanced.
Gemini 2.0 также будет использоваться в помощнике искусственного интеллекта, созданном специально для разработчиков. Помощник называется Jules, и он должен уметь выполнять задачи по кодированию на Python и Javascript.

