
DeepSeek представила експериментальну версію своєї флагманської моделі — V4 Flash Vision. Вона вміє обробляти не лише текст, а й зображення та скриншоти. Компанія стверджує, що за результатами тестів на роботу зі візуальною інформацією модель вже наближається до Claude Opus 4.8 від Anthropic.
Звичайна модель DeepSeek V4 Flash працює виключно з текстом. Нова ж DeepSeek-V4-Flash-Vision-Exp отримала можливість “бачити”. Тепер їй можна надати скриншот сайту, графік, документ або будь-яке інше зображення і попросити проаналізувати його вміст.
Варто зазначити, що результати тестів опублікувала сама DeepSeek. Незалежних перевірок V4 Flash Vision ще не проводилося, тому її реальна ефективність у сторонніх бенчмарках та завданнях ще потребує підтвердження.

Особливості обробки зображень
Ключова перевага V4 Flash Vision полягає в кількості токенів, що витрачаються на обробку зображень. DeepSeek встановила ліміт у 384 токени на одне зображення, причому вартість обробки відповідає стандартному тарифу V4 Flash. Для порівняння, інші моделі часто збільшують кількість токенів залежно від розміру або деталізації зображення. Наприклад, Anthropic зазначає, що зображення розміром 1000×1000 пікселів у Claude потребує 1296 токенів. Gemini ж розбиває великі зображення на фрагменти по 258 токенів кожен.
DeepSeek попередньо зменшує зображення приблизно до 800×800 пікселів перед передачею моделі. Однак, поки незрозуміло, чи не призводить таке зменшення до втрати дрібних деталей, таких як текст, кнопки та інші елементи інтерфейсу.
Раніше видання dev.ua повідомляло про те, що компанія DeepSeek знизила вартість своєї моделі V4 Pro на 75%.
