ШІ-гіганти вкладуть $100 млрд у нові дослідження через брак даних

Фото до статті

Колишній співробітник OpenAI Ендрю Хо вважає, що великі мовні моделі (LLM) мають проблеми з узагальненням знань. Навіть у програмуванні їхня продуктивність залишається нестабільною. На його думку, головна причина — брак якісних тренувальних даних.

Хо прогнозує, що для покращення продуктивності наступних поколінь LLM самого лише масштабування буде недостатньо. Очікується, що в найближчі роки ШІ-лабораторії витратять понад 100 мільярдів доларів на додатковий збір даних. Про це повідомляє видання The Decoder.

Експерт також скептично ставиться до високих оцінок вартості провідних лабораторій, таких як OpenAI чи Anthropic. За його словами, ці компанії є хронічно збитковими, оскільки змушені постійно вкладати значні кошти в нові моделі, щоб конкурувати з дешевшими суперниками, як-от Qwen чи Kimi.

Моделі стають спеціалізованими, а не універсальними

Скептицизм Хо поділяє дослідник Кембриджського університету Адам Хант. Його погляд на LLM змінився з оптимістичного на дедалі песимістичніший. Основний аргумент: новітні моделі не стають універсальними, а навпаки, дедалі вужче спеціалізуються. Здібності до програмування та складної математики продовжують зростати, тоді як якість мови та проста логіка стагнують або навіть погіршуються. Це узгоджується зі спостереженнями Хо щодо нерівномірної продуктивності моделей.

Зображення до статті

Хант пояснює це тим, що навчання з підкріпленням добре працює у сферах на кшталт програмування, де існують чіткі сигнали винагороди та повні тренувальні дані. В інших сферах таких даних просто немає. Ранній прогрес великих мовних моделей та їхня уявна здатність узагальнювати знання завдяки масштабу й міркуванню були радше побічним ефектом тренування на широкому текстовому корпусі, а не ознакою справжнього загального розуміння.

Питання узагальнення залишається відкритим

Дискусія постійно повертається до одного питання: чи здатні мовні моделі виробляти здібності, які виходять за межі відтворення та перекомбінування тренувальних даних, особливо там, де результати неможливо автоматично перевірити. Однозначної відповіді в наукової спільноти немає.

Сам Хант оцінює впевненість у власній тезі приблизно у 40% і визнає, що технологічний прогрес може його спростувати. Наприклад, якщо спеціалізовані LLM-моделі вдасться об’єднати у щось, що нагадуватиме більш загальний інтелект.

У нещодавній статті під назвою «LLMs can’t jump» Том Захаві з Google DeepMind пропонує структурне пояснення нерівномірності моделей: мовні моделі добре справляються з дедукцією та індукцією, але не здатні до творчої абдукції — тобто вигадування причини, для якої ще не існує мовного прецеденту. Як можливе рішення Захаві пропонує керовані світові моделі (world models), що дозволяють проводити контрфактичні експерименти. LLM усе ще можуть відігравати ключову роль у таких просунутих системах, навіть якщо самостійно вони натрапляють на власні межі.

Джерело

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *