Ssylka

Загадка Перевёрнутой тарелки: почему искусственный интеллект теряет овощи?

Современные большие языковые модели (LLM), впечатляющие своими способностями к генерации текста, всё ещё сталкиваются с трудностями в решении простых задач, требующих базового пространственного мышления. Эксперимент с перевёрнутой тарелкой, на которой лежат овощи, наглядно демонстрирует эту проблему. Человек, представив ситуацию, сразу поймет, что овощи упадут, но LLM часто выбирают неверные ответы, сосредотачиваясь на второстепенных деталях, например, на вопросе о том, является ли помидор овощем или фруктом.
Загадка Перевёрнутой тарелки: почему искусственный интеллект теряет овощи?
Изображение носит иллюстративный характер

Идея в том, что LLM, по сути, моделируют язык, а не реальность. Они стремятся предсказать следующее слово в предложении, а не проанализировать причинно-следственные связи, лежащие в основе ситуации. Это приводит к тому, что в простых ситуациях, где требуется не только знание языка, но и понимание физических законов или социальных норм, они терпят неудачу. Для LLM не существует понятия «важности» той или иной детали, кроме как ее влияние на следующее слово.

Проект "Simple Bench" предлагает набор подобных простых вопросов, которые могут легко решить большинство людей, но которые ставят LLM в тупик. Подобные тесты помогают выявить фундаментальные ограничения моделей, не сводящиеся к простому заучиванию ответов или проблемам токенизации. В основе лежит неспособность LLM моделировать ситуации в реальном мире и делать выводы на основе этой симуляции.

Успех LLM в некоторых областях, таких как сдача экзаменов, обусловлен тем, что знания и факты часто встречаются в языковой форме, которую модели хорошо умеют обрабатывать. Однако, как только модель выходит за пределы этого «комфортного» языкового поля и сталкивается с необходимостью анализировать ситуацию, опираясь на понимание реальности, она становится уязвимой. Прогресс в области искусственного интеллекта, возможно, потребует выхода за рамки простого масштабирования языковых моделей.


Новое на сайте

19021Хитроумная маскировка вредоноса GootLoader через тысячи склеенных архивов 19020Удастся ли знаменитому археологу Захи Хавассу найти гробницу Нефертити до ухода на покой? 19019Действительно ли «зомби-клетки» провоцируют самую распространенную форму эпилепсии и... 19018Генетический анализ мумий гепардов из саудовской Аравии открыл путь к возрождению... 19017Вредоносная кампания в Chrome перехватывает управление HR-системами и блокирует... 19016Глубоководные оползни раскрыли историю мегаземлетрясений зоны Каскадия за 7500 лет 19015Насколько глубоки ваши познания об эволюции и происхождении человека? 19014Как уязвимость CodeBreach в AWS CodeBuild могла привести к глобальной атаке через ошибку... 19013Затерянный фрагмент древней плиты пионер меняет карту сейсмических угроз Калифорнии 19012Генетические мутации вызывают слепоту менее чем в 30% случаев вопреки прежним прогнозам 19011Завершено строительство космического телескопа Nancy Grace Roman для поиска ста тысяч... 19010Вязкость пространства и фононы вакуума как разгадка аномалий расширения вселенной 19009Приведет ли массовое плодоношение дерева Риму к рекордному росту популяции какапо? 19008Как уязвимость CVE-2026-23550 в плагине Modular DS позволяет захватить управление сайтом? 19007Может ли уличная драка французского авантюриста раскрыть кризис американского гражданства...