1 час назад
Исследователи изучили языковые привычки Opus 5.5 и других моделей
Новое исследование маркетинговой фирмы Graphite изучило привычки письма передовых моделей, выявив любимые слова и фразы каждой из них. Организация обнаружила 13 000 фраз, которые встречались в контенте ИИ как минимум в два раза чаще, чем в созданном людьми.
Авторы отметили успешность борьбы со склонностью к длинным тире, однако заявили, что ИИ всё ещё использует конструкции с противопоставлением, причём каждая версия модели показывает свои уникальные особенности.
«Оказывается, модели Claude со временем приближаются к распределению слов, характерному для людей. А для моделей GPT — всё дальше», — рассказал TechCrunch основной специалист Graphite по искусственному интеллекту Грег Друк.
Изучение сгенерированного ИИ текста в больших масштабах потребовало тщательного планирования исследования. Graphite начала с корпуса из 10 000 статей, опубликованных до выпуска ChatGPT, который служил контрольной группой для анализа созданного людьми текста. Затем исследователи попросили разные модели ИИ переписать статьи на основе аннотаций, надеясь максимально исключить предвзятость источника. С помощью сопоставления образцов от людей и каждой модели они смогли сравнить, как часто определённые слова и фразы появлялись в текстах, сгенерированных ИИ, а также более общие закономерности в построении предложений.
В соответствии с результатам Graphite, наиболее характерным признаком Claude Opus 5.5 является слово «надёжный», которое встречается в 23 раза чаще, чем в человеческих примерах. Хотя Opus 5.5 теперь избегает конструкции предложений «это не X, это Y», он по‑прежнему склонен говорить, что что‑то «больше, чем X, это Y». Также схема любит объяснять, почему что‑то важно, используя фразу «это важно» в 116 раз чаще, чем в человеческом тексте, в то время как фраза «почему X важно» встречается в 92 раза чаще.
У Astra от OpenAI иной набор признаков. Эта модель любит описывать «другое измерение» того, о чем она говорит, и склонна уклоняться от прямого ответа, говоря, что действие «может обеспечить» определённую выгоду. Самый основной признак — это то, что Graphite называет «корректирующей формулировкой», когда тема определяется как «не просто X» или предлагается в качестве альтернативы, «вместо того чтобы полагаться на X». Согласно исследованиям Graphite, такие конструкции встречались более чем в 100 раз чаще в процессе генерации текста Astra, чем в человеческом письме.
Примечательно, что все передовые лаборатории, похоже, отреагировали на идею о том, что модели чрезмерно используют длинные тире. В образцах Graphite Opus 5.5 использовал этот знак препинания на 99% реже, чем Opus 5. Astra теперь использует его на 88% реже, чем человеческие образцы, в то время как Gemini 3.1 Pro почти полностью исключил длинные тире из текста.
Хотя отдельные признаки меняются, Graphite утверждает, что общее число в основном остается стабильным. «Им удаётся устранить самые известные признаки, но появляются и другие. И у каждой версии модели свои особенности», — сказал Друк.
В релизе Opus 5.5 компания Anthropic хвасталась тем, что модель «общается естественнее, чем предыдущие», заявив, что первые пользователи «нашли её текст более ясным и понятным». OpenAI делала аналогичные заявления при выпуске версий Sol и Luna на основе GPT-6, говоря, что пользователи могут «ожидать большей ясности, меньшего количества жаргона и странных оборотов речи».
Но Друк скептически относится к тому, насколько лаборатории могут полностью исключить характерные конструкции или фразы. «Моя общая гипотеза заключается в том, что лаборатории менее способны контролировать некоторые из этих вещей, чем можно было бы ожидать. Это гигантские модели с миллиардами параметров. У них есть конечное число тестов, которые можно провести, и некоторые вещи всё же проскальзывают», — заключил он.
Между тем эксперты стали замечать, что ИИ‑модели начинают общаться на не вполне понятном наречии. Он описывают как «смесь „Поминок по Финнегану“ Джойса и техжаргона». ИИ‑модели крупных разработчиков стали разрабатывать фразы, сокращения и значения слов, которым их никто не учил. Эксперты отмечают, что из‑за этого непонятного языка ИИ сложнее контролировать, а значит, возникают новые риски при его использовании.
Читают сейчас

19 минут назад
Версия обновления открытого проекта RustDesk 1.5.0
В начале октября 2206 года состоялся выпуск открытого мультиплатформеного проекта RustDesk 1.5.0. Это программа для удалённого рабочего стола, разработанное для самохостинга в качестве альтернативы Te
26 минут назад
Tesla представила игрушку для собак Dog Mode Chew Toy
Организация Tesla представила игрушку для собак, которую можно применять в электромобилях компании, чтобы развлечь питомца. Ознакомиться далее
46 минут назад
Microsoft Teams прекратит поддержку бесплатного онлайн‑чата
С 5 октября Microsoft прекращает поддержку чата Teams в режиме реального времени. Входящие запросы клиентов с корпоративных веб‑сайтов перестанут перенаправляться в корпоративные каналы, что может при

3 часа назад
В Mozilla Thunderbird стартовали разработку нативного приложения для iPhone и iPad
После многих лет отсутствия официального клиента для iOS, в команде проекта бесплатного кроссплатформенного инструмента для управления электронной почтой и новостными лентами Mozilla Thunderbird сообщ

15 часов назад
Sony добавила нейросетевое усовершенствование графики на обычную PS5
За нейросетевым улучшением картинки больше не обязательно идти покупать PS5 Pro. Sony представила QSSR — технологию масштабирования изображения для обычной PlayStation 5. Первыми поддержку получили Ma