Український інженер оживив модель ШІ на копійчаному чіпі

Український програміст першим у світі запустив повноцінну LLM на мікроконтролері за $10

Український розробник з Одеси, відомий на GitHub під ніком slvDev, довів, що для запуску великої мовної моделі (LLM) не потрібен потужний графічний процесор чи навіть повноцінний комп’ютер. Він реалізував проєкт ESP32-AI, у межах якого LLM з 28,9 мільйонами параметрів працює на мікроконтролері ESP32-S3 — платі вартістю менш ніж 10 доларів.

Український програміст першим у світі запустив повноцінну LLM на мікроконтролері за $10

Репозиторій з кодом ESP32-AI вже має 3,5 тисячі зірок на GitHub і 440 форків, як пише The Register.

Як «влізти» в мікроконтролер

ESP32-S3 — це не найпотужніший пристрій: чіп має лише 512 КБ оперативної пам’яті SRAM, 8 МБ додаткової PSRAM та 16 МБ флеш-накопичувача. Для порівняння, сучасні LLM-моделі зазвичай потребують десятків або й сотень гігабайтів пам’яті, оскільки кожен параметр моделі займає від одного до чотирьох байтів.

Щоб вмістити модель у такі обмежені ресурси, розробник застосував агресивну 4-бітну квантизацію. Після цього готова модель важить лише 14,9 МБ і повністю поміщається у вбудовану флеш-пам’ять плати.

Ключовою технічною знахідкою став підхід Per-Layer Embeddings (PLE), розроблений Google. За словами автора проєкту, це перша відома демонстрація адаптації цієї техніки до настільки обмеженого обладнання. Раніше подібні експерименти з мовними моделями на мікроконтролерах обмежувалися моделями приблизно з 260 тисячами параметрів — отже, новий проєкт більш ніж у сто разів масштабніший за попередні.

Швидкість генерації на рівні людини — і жодного зв’язку з хмарою

За результатами тестів, модель генерує текст зі швидкістю близько 9,88 токена за секунду — це швидше, ніж середньостатистична людина читає. Усі обчислення відбуваються повністю локально на платі: жодні дані не надсилаються на сервери, весь процес — від навчання до генерації — ізольований на самому чипі.

Основна модель, навчена на датасеті TinyStories від Microsoft, здатна генерувати короткі та доволі зв’язні історії. Розробник також створив другу модель, Barista, яка відповідає на запитання, але виключно на тему еспресо-кави, і працює приблизно вдвічі швидше за основну.

Чого не варто очікувати

Попри технічну вражаючість експерименту, його практична користь обмежена:

  • модель не підходить для створення чат-бота;
  • вона не вміє писати код;
  • її не можна використати для побудови автономного ШІ-агента;
  • функціонал обмежується генерацією простих історій або (у випадку Barista) відповідей на вузькоспеціалізовану тему.

Слава С. опублікував на GitHub повний код прошивки, скрипти для навчання моделі, конвеєр квантизації, схему підключення та результати експериментів. Отже, кожен охочий може відтворити проєкт самостійно.

Навіть попри «іграшковий» характер результату, сам факт роботи повноцінної мовної моделі на чіпі за 10 доларів демонструє, наскільки просунулися техніки стиснення ШІ-моделей. Це також натякає на потенціал використання флеш-пам’яті як багаторівневого сховища для ШІ-систем загалом.

Нагадаємо, що захисні обмеження у відкритих LLM можна зняти за 10 хвилин — навіть без технічних знань.

Джерело

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *