
Фото до статті
Андрій Савчук
Автор новин
Китайський розробник DeepSeek презентував експериментальну мультимодальну систему V4-Flash-Vision-Exp. Це візуальний варіант V4-Flash, який тепер може взаємодіяти не тільки з текстом, але й з зображеннями та скріншотами.
Ця система насамперед призначена для ШІ-агентів, яким необхідно аналізувати візуальну інформацію та виконувати завдання через інтерфейси, як зазначає The Decoder.

DeepSeek заявляє, що додавання візуальних можливостей не вплинуло на текстові спроможності V4-Flash. Модель зберегла свої здібності до міркувань, роботи з агентами та знання про світ, але тепер може аналізувати фотографії, діаграми, документи та елементи інтерфейсів користувача.
Особливу увагу привертають результати порівняння з Claude Opus 4.8 від Anthropic. Згідно з внутрішніми тестами DeepSeek, V4-Flash-Vision-Exp значно перевершує попередню текстову версію у мультимодальних агентних завданнях і в деяких тестах досягає рівня Claude Opus 4.8. Зокрема, модель DeepSeek отримала 27,3 бала проти 25,7 бала Claude в тесті Agents’ Last Exam, а в ZeroBench Pass@5 — 35 проти 34. Однак, в інших тестах перевага залишилася за Claude.

Слід зазначити, що поки що не варто вважати ці результати незалежним підтвердженням переваги DeepSeek. Тестування проводила сама китайська компанія, і наразі бракує повноцінних сторонніх порівнянь цієї нової експериментальної моделі.
Однією з ключових переваг V4-Flash-Vision-Exp може стати її вартість. DeepSeek не збільшила ціни порівняно зі звичайною V4-Flash. Обробка одного зображення коштує максимум 384 токени, що дозволяє значно зменшити витрати при роботі з великими обсягами візуальної інформації. За оцінками іноземних джерел, це робить модель однією з найдоступніших мультимодальних альтернатив для розробників.
Нова модель наразі має статус Experimental і доступна через API. DeepSeek не опублікувала повну технічну інформацію про її структуру, тому на даний момент невідомо, наскільки значні внутрішні зміни порівняно з V4-Flash.
Таким чином, DeepSeek прагне інтегрувати сильні сторони своєї доступної V4-Flash у сферу мультимодальних ШІ-агентів. Якщо заявлені результати будуть підтверджені незалежними тестами, V4-Flash-Vision-Exp може стати значно бюджетнішою альтернативою провідним моделям, таким як Claude Opus 4.8, для завдань, що вимагають одночасної обробки тексту, зображень та інтерфейсів.
Нагадаємо, нещодавно стало відомо, що DeepSeek розробляє власний інструмент для агентного кодування — прямого конкурента Claude Code та Codex.
Головна > Новини > DeepSeek випустила V4-Flash-Vision-Exp — дешеву мультимодальну модель, яка працює на рівні Claude Opus 4.8
Джерело
