Новости

Новости технологий: Researchers show that — 24.10.2025

Исследование показывает, что обучение больших языковых моделей на «бесполезных» данных может привести к ухудшению их работы и даже к «гибели» модели

Новости технологий: Researchers show that — 24.10.2025
Новости технологий: Researchers show that — 24.10.2025 – технологические новости и аналитика
Новости технологий: Researchers show that — 24.10.2025

Исследование показывает, что обучение больших языковых моделей на «бесполезных» данных может привести к ухудшению их работы и даже к «гибели» модели

📋 Обзор

Исследование показывает, что обучение больших языковых моделей на «бесполезных» данных может привести к ухудшению их работы и даже к «гибели» модели

На первый взгляд кажется очевидным: чем выше качество данных, тем лучше будет результат обучения крупных языковых моделей (КМЯМ). В реальности же ситуация оказывается сложнее и более зыбкой. Новое исследование, проведенное группой ученых, подчеркивает, что использование низкосортных, «бесполезных» данных может не только снизить эффективность модели, но и привести к необратимым повреждениям, так называемому «brain rot» — «гибели разума» ИИ.

Что такое «brain rot» при обучении ИИ? Термин, взятый из медицинской и биологической сферы, в контексте машинного обучения приобретает метафорический смысл: модель, подвергающаяся постоянному обучению на бессмысленных или противоречивых данных, со временем теряет способность давать адекватные ответы, становится «заторможенной» и уязвимой к ошибкам, а в худших случаях — полностью выходит из строя. Исследование показало, что даже небольшие дозы «бесполезных» данных, неотличимых на первый взгляд от качественного контента, способны разрушительно повлиять на обучающийся ИИ. Особенно это заметно при масштабных тренировках, когда модели поглощают миллиарды примером, среди которых могут быть и случайные, случайно сгенерированные или даже вредоносные данные. В результате модель теряет свои ориентиры, и её ответы начинают быть случайными или неконсистентными. Доказательства показывают, что при использовании даже 10% «низкокачественного» материала эффективность обученной модели заметно снижается. В российских реалиях это особенно важно учитывать, например, при обучении систем автоматического перевода или чат-ботов, где качество данных зачастую варьируется из-за дефицита ресурсов или недобросовестных поставщиков данных. Российские компании, разрабатывающие собственные АИ-решения, должны обращать особое внимание на фильтрацию и проверку данных. Использование сомнительных источников, типа нелегальных форумов, сгенерированных патчей или автоматизированных спам-кампаний, рискует не просто замедлить развитие проекта, а вывести систему из строя. Особенно в условии санкций и ограниченного доступа к зарубежным качественным датасетам необходимость контроля данных становится еще более актуальной. Некоторые исследователи предлагают подходы к оценке «качества» данных, внедрение автоматизированных систем фильтрации и «чистки» данных. Для России это особенно важно — во избежание «заражений» модели мусорными данными, которые могут стать причиной того, что даже спустя годы обучения искусственный интеллект начнет давать некорректные или вредоносные ответы, что опасно для всевозможных приложений — от чат-ботов для обслуживания клиентов до систем автоматического перевода и аналитики. В целом, выводы исследования подчеркивают простую, но важную истину: качество данных — это ключ к успешному развитию ИИ. И если в России российские ИТ-компании и научные учреждения научатся избегать ловушки «бесполезных» данных, их системы смогут стать гораздо надежнее, устойчивее и понятнее для пользователей.

Источник: Аналитические данные и отраслевые отчеты

Следите за новостями технологий в нашем Telegram-канале и не пропускайте важные обновления!

Источник: arstechnica.com