Позволит ли отказ от SFT в обучении ИИ создать прорыв?

DeepSeek R1-Zero, в отличие от R1, не использует человеческую разметку (SFT) для обучения цепочек рассуждений (CoT), полагаясь исключительно на обучение с подкреплением. Это открытие ставит под сомнение необходимость SFT для создания точных и четких рассуждений в областях, где возможна строгая верификация. R1-Zero демонстрирует, что внутренний язык предметной области может быть сформирован исключительно через оптимизацию RL, хотя SFT по-прежнему требуется для обобщения рассуждений в разных областях.
Позволит ли отказ от SFT в обучении ИИ создать прорыв?
Изображение носит иллюстративный характер

Экономика ИИ претерпевает сдвиги: затраты на обучение переходят в затраты на инференс для повышения точности и надежности. Этот сдвиг обусловлен необходимостью преодоления ненадежности ИИ-агентов, являющейся главным препятствием для их широкого применения. Теперь компании готовы платить больше за надежную работу ИИ, что приведет к росту спроса на вычислительные ресурсы для инференса.

Системы рассуждений открывают новые возможности для обучения ИИ. Они не только улучшают точность ответов, но и генерируют «реальные» данные в процессе инференса. Таким образом, клиенты, платя за использование ИИ, одновременно предоставляют новые качественные данные, которые улучшают модель, создавая самоподдерживающийся цикл. Этот процесс обучения через инференс в конечном итоге может превзойти предварительное обучение на человеческих данных.

Открытость DeepSeek R1 способствует развитию исследований CoT и поиска, что ускоряет прогресс в области ИИ. Это направление исследований может привести к реализации AGI, поскольку появляется возможность масштабировать процесс без участия человека.


Новое на сайте

19905Зачем древние египтяне строили круглые храмы? 19904Планета, на которой вы живёте, но почти не знаете 19903Может ли анализ крови остановить рак печени ещё до его начала? 19902Кто такие GopherWhisper и зачем им монгольские чиновники? 19901«Вояджер-1» готовится к манёвру «большой взрыв»: NASA отключает приборы ради выживания 19900Почему вокруг Чатемских островов появилось светящееся кольцо из планктона? 19899Как взлом Vercel начался с Roblox-скрипта на чужом компьютере 19898Кто лежит в шотландских гробницах каменного века? 19897Почему две англосаксонские сестра и брат были похоронены в объятиях 1400 лет назад? 19896Гормон GDF15: найдена причина мучительного токсикоза у беременных 19895Почему хакеры Harvester прячут вредоносный код в папке «Zomato Pizza»? 19894Робот-гуманоид Panther от UniX AI претендует на место в каждом доме 19893Artemis застряла на земле: NASA не может лететь на луну без новых скафандров 19892Почему 20 000 промышленных устройств по всему миру оказались под угрозой взлома? 19891Зачем египетская мумия «проглотила» «Илиаду»?
Ссылка