ИИ должен учиться непрерывно, чтобы стать AGI. Но с этим задача

3 мин
ИИ должен учиться непрерывно, чтобы стать AGI. Но с этим задача

Чтобы приблизиться к настоящему универсальному ИИ (AGI), схема должна уметь дообучаться без остановки — впитывать новые факты и навыки прямо по мере работы. Новое исследование лаборатории Zyphra показало, что большие языковые модели справляются с этим плохо: после долгого обучения они постепенно теряют саму способность усваивать новое. Важно не перепутать: речь не про забывание и не про "поглупение". Старое схема помнит прекрасно — она именно разучивается учиться. Похоже на опытного сотрудника, который ничего из накопленного не растерял, но за годы в одной колее все тяжелее берется за незнакомые задачи. У этого явления есть имя — потеря пластичности.

Чтобы поймать эффект, модели разных размеров — от 5 до 314 млн параметров — долго прогоняли через поток из восьми языков (английский, русский, китайский, французский, японский и так далее), а время от времени проверяли, насколько быстро они выучивают совсем свежий язык, которого в потоке не было, — вьетнамский. Картина получилась наглядной: чем дольше шло обучение, тем хуже модели давался этот новичок.

Основной вопрос был про масштаб: спасает ли он? И да, и нет. Чем крупнее схема, тем позже наступает эта "закостенелость" — но "никогда" не наступает ни у одной. Размер лишь оттягивает момент, причем со все меньшей отдачей: момент наступления подчиняется простому степенному закону и растет медленнее, чем сама модель. Грубо говоря, просто раздуть модель, чтобы избавиться от проблемы, не выйдет — это неэффективный путь. По прогнозу из той же формулы (именно прогноз, прямых замеров на таких размерах нет) модель на миллиард параметров начала бы терять пластичность примерно к 1,8 трлн обработанных токенов. И самый неуютный результат: эффект проявился даже при обычном длительном предобучении на стационарных данных, а не только в искусственном сценарии с резким переключением языков.

Почему это вообще занимает исследователей. Непрерывное обучение могло бы снять одну из главных болей нынешних моделей — knowledge cuttof или фиксированную "дату знаний", после которой модель ничего не знает о мире. Тот же алгоритм позволил бы, например, кодинг-агенту осваивать новую кодовую базу по ходу дела, а не затаскивать ее полностью в гигантский промпт. Если же способность учиться со временем тает, вся эта картина непрерывно адаптирующегося ИИ упирается в стену.

Важно, что модели в эксперименте небольшие по меркам фронтира; цифры про миллиард параметров — экстраполяция, а не наблюдение. Механизма разработчики тоже пока не нашли: они проверили обычных подозреваемых — затухающие нейроны, "обленившиеся" головы внимания, рост весов, — но ни один не объясняет эффект целиком.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Читают сейчас

32 минуты назад

OpenAI добавила плагины в голосовой режим ChatGPT

OpenAI расширила возможности Live Voice в ChatGPT: теперь во время голосового разговора можно применять подключённые плагины и приложения. Функция доступна в веб-версии, а также на iOS и Android. Асси

Учёные выдвинули теорию о тёмных измерениях и первичных чёрных дырах

1 час назад

Учёные выдвинули теорию о тёмных измерениях и первичных чёрных дырах

Все мы заперты в трёх привычных пространственных и одном временном измерении, однако это не означает, что гравитация не может проникать в другие измерения, если они существуют. И у нас может появиться

DrivingBench проверили GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 и Claude Fable 5.1 на функция управлять авто

1 час назад

DrivingBench проверили GPT-6 Astra, GPT-5.6 Sol, Grok 4.6 и Claude Fable 5.1 на функция управлять авто

Исследователи из DrivingBench проверили, как современные нейросети умеют водить автомобиль. В контексте этого проекта ИИ-системы OpenAI GPT-6 Astra и GPT-5.6 Sol, SpaceXAI Grok 4.6 и Anthropic Claude

Beyond Good & Evil 2 все еще жива: создание продолжается спустя 18 лет после анонса

3 часа назад

Beyond Good & Evil 2 все еще жива: создание продолжается спустя 18 лет после анонса

Долгострой Beyond Good & Evil 2 продолжает подавать признаки жизни. Ведущий сценарист и помощник нарративного директора Ubisoft Bordeaux Рик Годвин рассказал, что последние некоторое количество месяце

950 Claude-агентов за 21 час нашли новую биологическую систему

4 часа назад

950 Claude-агентов за 21 час нашли новую биологическую систему

Anthropic запустили приблизительно 950 агентов, которые изучили более 200 тысяч обратных транскриптаз, то есть ферментов, способных синтезировать ДНК на основе РНК. За 21 час и 210 млн токенов они ото