8 апреля 2026, 16:27
Тестирование показало, что AI Overviews от Google выдаёт миллионы ложных ответов в час

Опция AI Overviews (ИИ-обзоры) в поисковой системе Google Search выдаёт миллионы ложных ответов в час, показало тестирование New York Times. Запущенный в 2024 году средство использует несколько компонентов, включая языковые модели Gemini.
NYT указывает, что ИИ-обзоры точны в 90% случаев. Газета провела анализ функции совместно со стартапом Oumi, который сам разрабатывает модели искусственного интеллекта. Организация использовала для проверки AI Overviews бенчмарк SimpleQA от OpenAI, а также собственные ИИ-инструменты. Тест производительности включает более 4 тыс. вопросов с проверяемыми ответами, чтобы оценить выдачу модели.
Oumi начала тестирование в прошлом году, когда актуальной моделью Google была Gemini 2.5. Тогда тест представил точность в 85%. Когда испытание провели после релиза Gemini 3, AI Overviews отвечала правильно на 91% вопросов. Если связать этот процент со всеми запросами в поисковике Google, то станет ясно, что ИИ-обзоры генерируют десятки миллионов неверных ответов ежедневно.
В одном из примеров у AI Overviews попросили назвать дату, когда дом музыканта Боба Марли стал музеем. Функция сослалась на три страницы, две из которых не содержали этой даты. На последней странице, из «Википедии», есть два противоречащие другу года, но инструмент выбрал неверный.
Пресс-секретарь Google Нед Адрианс заявил, что SimpleQA содержит неверную информацию. Часто модели оценивают на аналогичном тесте под названием SimpleQA Verified, который использует меньший набор вопросов, прошедших более тщательную проверку. В исследовании NYT и Oumi есть серьёзные недостатки, оно не отражает того, что люди ищут в Google на самом деле, подчеркнул Адрианс.
Издание Ars Technica указывает, что оценка новых ИИ-моделей больше напоминает искусство, чем науку — это представляет собой проблему. У каждой компании есть свой предпочтительный метод демонстрации возможностей модели, а недетерминированная природа генеративного ИИ способна затруднить проверку. Oumi использует ИИ-инструменты для оценки, а модели в их основе также могут галлюцинировать.
В дополнение к этого, AI Overviews — это не монолитная модель. Google сообщила, что использует «правильную схема» для каждого запроса. ИИ-обзоры выдавали бы наилучшие ответы, если бы постоянно использовали Gemini 3.1 Pro, но это медленно и затратно. Для быстрой загрузки информации на страницу поиска опция применяет более быстрые модели Gemini Flash.
Год назад кулинарные блогеры обвинили AI Overviews в снижении трафика на свои сайты. ИИ-обзоры генерировали бессмысленные рецепты и ремиксы реальных рецептов, сопровождая их сгенерированными изображениями блюд. В некоторых случаях ИИ-обзоры содержали ссылки на реальные рецепты, но сам ответ содержал множество неточностей.
Читают сейчас

1 час назад
Вышло апдейт Phiola 2.11 — открытого портативного мультиплатформенного аудиоплеера с поддержкой скриптов
В начале октября 2026 года состоялся выпуск обновления открытого проекта Phiola 2.11. Это мобильный аудиоплеер/рекордер со встроенными кодеками, поддержкой скриптов и воспроизведением на Windows, Linu

1 час назад
Версия дистрибутива Parrot OS 7.4 для этичного хакинга с ядром Linux 7.1
3 октября 2026 года организация Parrot Security представила дистрибутив Parrot OS 7.4 на базе Debian 13.6 Trixie и ядра Linux 7.1. Решение ориентировано на безопасность и предназначено для тестировани
7 часов назад
Новости $mol и Giper Dev
Спасибо за помощь с выпуском @amigun TLDR: сопровождение Node.js в $mol_storage, новые инструменты для работы с интерфейсами, WYSIWYG-редактор, GTK-модуль, компонент отзывов и улучшения безопасности в

8 часов назад
Google урежет бесплатный Gemini до Flash-Lite
Google поменяет доступ к моделям в Gemini Apps. С 9 октября организация начнёт поэтапно ограничивать набор моделей для пользователей без подписки: останется только Gemini Flash-Lite. Flash и Pro из бе

11 часов назад
Anthropic запустила Claude Frontier Academy и вложит $100 млн в обучение инженеров
Anthropic планирует вложить $100 млн в обучение инженеров для реализации ИИ‑проектов в компаниях. Компания запустила инициативу Claude Frontier Academy, которая призвана преодолеть нехватку специалист