Штучний інтелект не усвідомлює плин часу, й навіть не здогадується про його існування.

Фото до статті

Андрій Савчук

Автор новин

Свіже дослідження виявило: популярні асистенти на основі штучного інтелекту не можуть точно прогнозувати час, необхідний для виконання завдання, і так само не спроможні достовірно оцінити, скільки часу вони вже над ним працюють. Для завдань, що виконуються автономно протягом годин, це становить серйозну проблему для людського контролю — як повідомляє The Decoder.

Хто і як це перевіряв

Дослідження провели два незалежні експерти зі штучного інтелекту в рамках дослідницької програми MATS. Вони випробували два поширені кодувальні асистенти — Claude Code від Anthropic та Codex від OpenAI — щодо їхньої здатності сприймати час.

Перед кожним завданням з програмування агенти мали надати оцінку очікуваного часу на його виконання. Після цього вони виконували завдання і вже після його завершення звітували про, на їхню думку, минулий час. Для тестів було використано 200 завдань зі збірки ProgramBench, а також власний набір дослідників із 18 тестів під назвою AgentTime.

Агенти систематично завищують оцінки часу

Під час тестів агенти послідовно завищували оцінки необхідного їм часу. У ProgramBench обидві моделі переважно вказували приблизно 90 хвилин, незалежно від реальної складності завдання. У другому циклі тестування Claude припускався помилки в середньому втричі, тоді як Codex — у шість-десять разів. Найгірші результати були зафіксовані на коротких завданнях, і лише в діапазоні кількох годин деякі прогнози наближалися до реальності.

За даними авторів дослідження, на бенчмарку AgentTime модель Fable 5 в середньому перевищувала фактичний час виконання приблизно втричі, а GPT-5.6 Sol — приблизно у сім разів, причому розрив був особливо значним на коротких завданнях.

Одна й та сама модель поводиться по-різному залежно від оточення

Результати значною мірою залежать від програмного середовища (harness), у якому функціонує модель. Claude Code продовжує роботу, доки не вважатиме завдання виконаним — медіанний час становить близько 90 хвилин. Codex, натомість, зупиняється приблизно через півгодини, майже незалежно від складності завдання. Згідно з дослідженням, одна й та сама мовна модель виконує в середньому в 2,5 рази більше кроків у Claude Code, ніж у Codex. Це означає, що тривалість роботи залежить не тільки від самої моделі, а й значною мірою від програмного оточення, в якому вона працює.

Агенти так само погано оцінюють якість власної роботи

Старіші моделі — Opus 4.8 та GPT-5.5 — в середньому завищували оцінку власних результатів на 20 пунктів і виставляли собі високі бали навіть за невдалі завдання. В одному з випадків обидві моделі оцінили свою роботу приблизно на 70% успішності, хоча реальні показники становили 7% і 14,5% відповідно.

Чому це важливо

Дослідники підкреслюють, що здатність до самооцінки має значення. Щоб агент міг надійно працювати над тривалими завданнями, які тривають годинами, він повинен вміти виконувати інструкції на кшталт «попрацюй над цим завданням протягом двох годин». Агентом, який постійно невірно оцінює час, важко керувати.

Надалі автори планують перевірити, чи здатні агенти дотримуватися встановленої тривалості роботи. Показово, що коли агентам надавали доступ до інструменту, який повідомляє про реальний хід часу, вони майже завжди давали правильну відповідь. Це свідчить про те, що проблема не в принциповій нездатності орієнтуватися в часі, а саме у відсутності доступу до відповідної інформації за замовчуванням.

Нагадаємо, що Claude Opus 5 за один запит створив повноцінний шутер у стилі Call of Duty.

Головна > Новини > Штучний інтелект не відчуває часу — і навіть не підозрює про це

Джерело

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *