Qwen3.8-Max: 16 днів безперервного кодування – новий рекорд для відкритих LLM

Фото до статті

Компанія Alibaba представила нову флагманську модель Qwen3.8-Max, яка випереджає нещодавнього фаворита, модель Kimi K3 від Moonshot AI, за низкою показників. Реліз став черговим підтвердженням того, наскільки швидко китайські розробники скорочують відстань від лідерів ринку, таких як Anthropic та OpenAI.

Qwen3.8-Max скинув Kimi K3 з трону: Alibaba випустила модель на 2,4 трильйона параметрів

Що таке Qwen3.8-Max

19 липня Qwen3.8-Max було представлено у вигляді попередньої версії, а тепер компанія анонсувала повноцінний реліз. Нова велика мовна модель (LLM) функціонує за архітектурою «суміш експертів». Вона має 2,4 трильйона параметрів, але водночас активно використовує лише 95 мільярдів, що сприяє зменшенню обчислювальних витрат та прискоренню отримання відповідей. Модель є мультимодальною, тобто здатною обробляти текстову, візуальну та відеоінформацію. Вікно її контексту сягає 1 мільйона токенів, а максимальний обсяг виведення становить близько 131 тисячі токенів.

Наразі модель доступна через хмарну платформу QwenCloud, включаючи API, сумісний з форматом OpenAI. Alibaba також обіцяє опублікувати відкриті ваги моделі на платформах Hugging Face та ModelScope вже наступного тижня. Це вперше, коли компанія робить доступною модель найвищого рівня у відкритому доступі.

Kimi K3 втрачає лідерство серед відкритих моделей

На початку липня модель Kimi K3 від Moonshot AI (2,8 трильйона параметрів) спричинила справжній фурор, посівши перше місце в рейтингу Arena Frontend Code. Вона обійшла навіть такі моделі, як Claude Fable 5 та GPT-5.6 Sol. Kimi K3 отримала оцінку 57 балів за індексом штучного інтелекту Artificial Analysis, зайнявши четверте місце серед 189 протестованих моделей. Це був найвищий показник для LLM з відкритими вагами.

Однак після виходу Qwen3.8-Max ситуація змінилася. За даними рейтингу Arena Code, нова модель від Alibaba обійшла Kimi K3 приблизно на 6 балів, поступившись лише Claude Fable 5 (приблизно на 12,6 бала). За результатами семи тестів, що охоплюють кодування, виконання завдань за допомогою агентів та загальні здібності, Qwen3.8-Max випереджає GPT-5.6 Sol та Fable 5. У 36 мультимодальних та відео-тестах вона демонструє кращі результати, ніж обидві згадані моделі. Як повідомляє Bloomberg, у кількох лідербордах Arena Qwen3.8-Max поступається лише розробкам Anthropic.

Отже, за менш ніж три тижні ринок відкритих моделей зазнав значних змін: Kimi K3 недовго утримувала лідерство, а Qwen3.8-Max відібрала в неї позицію провідної відкритої системи.

Модель Розробник Параметри Індекс Artificial Analysis Позиція на Arena Code
Claude Fable 5 Anthropic не розкрито ≈60 (1 місце) лідер
GPT-5.6 Sol OpenAI не розкрито ≈59 2–3 місце
Qwen3.8-Max Alibaba 2,4 трлн (95 млрд активних) офіційно не опубліковано 2 місце, +6 балів до Kimi K3
Claude Opus 4.8 Anthropic не розкрито ≈56–57 на рівні Kimi K3
Kimi K3 Moonshot AI 2,8 трлн (16 з 896 експертів активні) 57 (4 місце) втратив 1 місце в кодуванні

Слід зазначити, що власні оцінки Alibaba, які ставлять модель на «друге місце після Fable 5», наразі базуються переважно на внутрішніх тестах компанії та спостереженнях спільноти на публічних лідербордах. Незалежні лабораторії ще не встигли протестувати як хмарну версію, так і майбутні відкриті ваги моделі.

Автономне кодування як головний аргумент

Alibaba зробила ставку не лише на бенчмарки, а й на демонстрацію тривалої автономної роботи. За заявами компанії, Qwen3.8-Max протягом 16 днів самостійно розробляла та підтримувала проєкт кодового агента під назвою oh-my-cli. Завдання надходили через GitHub issues, агенти брали їх у роботу, а зміни проходили тестування та перевірку пул-реквестів. Станом на 30 липня проєкт налічував 265 комітів, 127 пул-реквестів і 151 issue. До 3 серпня кількість комітів зросла до 424.

В іншому експерименті модель відтворила результати наукової статті про відбір даних для навчання, а потім спробувала вдосконалити описаний метод. Процес тривав близько 125 годин, за цей час було згенеровано приблизно 7600 рядків коду. Робота включала понад 1100 дій та 33 цикли навчання GPU без втручання людини.

Ціни

Використання Qwen3.8-Max на платформі QwenCloud коштує 2 долари за мільйон вхідних токенів та 6 доларів за мільйон вихідних. Для кешованого вводу діють нижчі тарифи. Це значно дешевше, ніж флагманські моделі від Anthropic та OpenAI. За попередніми даними, Claude Fable 5 оцінюється приблизно в 10 доларів за вхідні та 50 доларів за вихідні мільйони токенів. Для порівняння, попередня версія моделі, Qwen3.7-Max, коштувала 2,50 та 7,50 долара відповідно. Це означає, що новий флагман фактично став трохи дешевшим, попри значне зростання кількості параметрів.

Низька ціна, поєднана із заявленою продуктивністю, що наближається до рівня Fable 5 та GPT-5.6 Sol, є головним аргументом Alibaba в боротьбі за розробників. Компанія розраховує, що доступ через API привабить платний трафік до хмари QwenCloud ще до того, як зважений реліз стане доступним для самостійного розгортання.

Кон

Реліз Qwen3.8-Max відбувся на тлі активних запусків нових моделей від китайських розробників. Минулого тижня DeepSeek розширила доступ до своєї моделі V4 Flash, а Moonshot AI ще в середині липня випустила Kimi K3. Акції Alibaba на Гонконгській біржі зросли більш ніж на 6% після анонсу, оскільки інвестори роблять ставку на комерційний успіх моделі у хмарному бізнесі компанії.

Зростаючий тиск з боку китайських LLM може змусити OpenAI та Anthropic переглянути свою цінову політику та запропонувати розробникам більш гнучкі варіанти розгортання.

Нагадаємо, що OpenAI готується до значного зниження цін на токени, аби зберегти конкурентоспроможність у боротьбі з Anthropic за користувачів.

Джерело

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *