8 апреля 2026, 16:27

Тестирование показало, что AI Overviews от Google выдаёт миллионы ложных ответов в час

2 мин

Опция AI Overviews (ИИ-обзоры) в поисковой системе Google Search выдаёт миллионы ложных ответов в час, показало тестирование New York Times. Запущенный в 2024 году средство использует несколько компонентов, включая языковые модели Gemini.

NYT указывает, что ИИ-обзоры точны в 90% случаев. Газета провела анализ функции совместно со стартапом Oumi, который сам разрабатывает модели искусственного интеллекта. Организация использовала для проверки AI Overviews бенчмарк SimpleQA от OpenAI, а также собственные ИИ-инструменты. Тест производительности включает более 4 тыс. вопросов с проверяемыми ответами, чтобы оценить выдачу модели.

Oumi начала тестирование в прошлом году, когда актуальной моделью Google была Gemini 2.5. Тогда тест представил точность в 85%. Когда испытание провели после релиза Gemini 3, AI Overviews отвечала правильно на 91% вопросов. Если связать этот процент со всеми запросами в поисковике Google, то станет ясно, что ИИ-обзоры генерируют десятки миллионов неверных ответов ежедневно.

В одном из примеров у AI Overviews попросили назвать дату, когда дом музыканта Боба Марли стал музеем. Функция сослалась на три страницы, две из которых не содержали этой даты. На последней странице, из «Википедии», есть два противоречащие другу года, но инструмент выбрал неверный.

Пресс-секретарь Google Нед Адрианс заявил, что SimpleQA содержит неверную информацию. Часто модели оценивают на аналогичном тесте под названием SimpleQA Verified, который использует меньший набор вопросов, прошедших более тщательную проверку. В исследовании NYT и Oumi есть серьёзные недостатки, оно не отражает того, что люди ищут в Google на самом деле, подчеркнул Адрианс.

Издание Ars Technica указывает, что оценка новых ИИ-моделей больше напоминает искусство, чем науку — это представляет собой проблему. У каждой компании есть свой предпочтительный метод демонстрации возможностей модели, а недетерминированная природа генеративного ИИ способна затруднить проверку. Oumi использует ИИ-инструменты для оценки, а модели в их основе также могут галлюцинировать.

В дополнение к этого, AI Overviews — это не монолитная модель. Google сообщила, что использует «правильную схема» для каждого запроса. ИИ-обзоры выдавали бы наилучшие ответы, если бы постоянно использовали Gemini 3.1 Pro, но это медленно и затратно. Для быстрой загрузки информации на страницу поиска опция применяет более быстрые модели Gemini Flash.

Год назад кулинарные блогеры обвинили AI Overviews в снижении трафика на свои сайты. ИИ-обзоры генерировали бессмысленные рецепты и ремиксы реальных рецептов, сопровождая их сгенерированными изображениями блюд. В некоторых случаях ИИ-обзоры содержали ссылки на реальные рецепты, но сам ответ содержал множество неточностей.

ai overviews ии-обзоры google gemini nyt oumi тестирование исследование

Читают сейчас

18 минут назад

Google выпустила рекламу, в которой отцы-основатели США с помощью ИИ создают Декларацию независимости

Спустя 250 лет после подписания Декларации независимости в новом рекламном ролике Google задается вопросом: что, если бы отцы-основатели США имели доступ к Google Workspace? Читать далее

2 часа назад

Meta* выпустила нейросеть Muse Image — она думает, гуглит и пишет исходник перед генерацией картинки

Meta* представила Muse Image — первую модель генерации изображений от Meta Superintelligence Labs (компания Meta* признана экстремистской и запрещена в РФ). Это следующий крупный выпуск лаборатории по

4 часа назад

Джон Ромеро публично поддержал разработчиков после массового увольнения в id Software

Один из основателей id Software Джон Ромеро поддержал разработчиков студии после масштабных сокращений. В июле 2026 года студия лишилась около половины своего штата. Читать далее

4 часа назад

DJI выпустила Mic Mini 2S — беспроводную петличку с 32-битной записью и встроенной в передатчик памятью

DJI выпустила Mic Mini 2S — компактную беспроводную микрофонную систему для блогеров, видеооператоров и создателей контента. Главные отличия от обычной версии Mic Mini 2: 32-битная запись аудио, встро

4 часа назад

Нобелевский лауреат по экономике предупредил, что ИИ не вернёт эпоху быстрого роста производительности

Лауреат Нобелевской премии по экономике 2010 года Кристофер Писсаридес объявил, что технологии ИИ не вернут западные экономики в эпоху стремительного роста производительности труда — и такие времена,