
Український розробник slvDev запустив мовну модель із майже 29 мільйонами параметрів на мікроконтролері ESP32-S3. Плата коштує менше ніж 10 доларів, а модель генерує текст повністю локально — без підключення до серверів чи хмарних сервісів.
Проєкт отримав назву ESP32-AI. За даними розробника, модель генерує близько 9,88 токена за секунду та виводить текст на невеликий екран, під’єднаний до плати. На відео можна побачити, як модель створює невелику історію про дівчинку Лілі. «Так! Вона працює! Вона жива! Це неймовірно!» — вигукує її розробник.
ESP32-S3 має лише 512 кілобайтів швидкої оперативної пам’яті. Цього замало, щоб запустити модель із такою великою кількістю параметрів. Тому розробник стиснув модель до 4-бітного формату, зменшивши її вагу до всього 15 мегабайтів. До того ж, не вся модель використовує оперативну пам’ять. Більшість її параметрів зберігаються у флешпам’яті, тож під час генерації модель може просто підвантажувати звідти невеликі фрагменти, потрібні для наступного токена.
Модель створена на наборі даних TinyStories, тож вона вміє створювати невеликі історії. Тому вона не може відповісти на запитання чи виконати інші інструкції. Проте розробник стверджує, що найцікавішим у цьому експерименті є те, що цю велику модель вдалося розмістити на крихітному чіпі, а не те, на що ця модель здатна.
Також розробник створив іншу схожу модель. Вона називається Barista і може відповідати на запитання про приготування еспресо. slvDev поділився відео, де розповідає моделі, що його еспресо має підгорілий смак. Barista робить висновок, що найімовірніше, це через переекстракцію. Можливо, кава довго контактувала з гарячою водою, або є занадто дрібно змеленою. А потім модель запитує про дозування, вагу готової кави та час екстракції.
an espresso Q/A model running fully offline on an ESP32S3
by u/slvDev_ in LocalLLaMA
slvDev також опублікував на Github код прошивки, інструменти для навчання моделі та інструкції, за допомогою яких експеримент можна відтворити самостійно.
