Штучний інтелект не сприймає плин часу, він навіть не усвідомлює цього.

Фото до статті

Андрій Савчук

Автор новин

Нове дослідження виявило: популярні помічники на основі штучного інтелекту не здатні точно прогнозувати тривалість виконання завдання, і так само не можуть достовірно оцінити, скільки часу вони вже над ним працюють. Для завдань, що виконуються автономно годинами, це створює реальну проблему контролю з боку людини — про це повідомляє The Decoder.

Хто і як це перевіряв

Дослідження провели два незалежні дослідники штучного інтелекту в межах дослідницької програми MATS. Вони протестували два широко використовувані кодувальні асистенти — Claude Code від Anthropic та Codex від OpenAI — саме на відчуття часу.

Перед кожним завданням з програмування агенти мали оцінити, скільки часу їм знадобиться на виконання. Потім вони розв’язували задачу і вже постфактум звітували, скільки часу, на їхню думку, минуло. Матеріалом для тестів слугували 200 завдань зі збірки ProgramBench, а також власний набір дослідників із 18 бенчмарків під назвою AgentTime.

Агенти систематично завищують оцінки часу

У тестах агенти послідовно переоцінювали, скільки часу їм знадобиться. У ProgramBench обидві моделі здебільшого називали приблизно 90 хвилин незалежно від реальної складності завдання. У другому раунді тестування Claude помилявся в середньому втричі, а Codex — у шість-десять разів. Найгірші результати спостерігалися на коротких задачах, і лише в діапазоні кількох годин деякі прогнози наближалися до реальності.

За даними авторів дослідження, на бенчмарку AgentTime модель Fable 5 у середньому перевищувала фактичний час виконання приблизно втричі, а GPT-5.6 Sol — приблизно у сім разів, причому розрив був особливо великим саме на коротких завданнях.

Одна й та сама модель поводиться по-різному залежно від оточення

Результати суттєво залежать від програмного середовища (harness), у якому працює модель. Claude Code продовжує роботу, доки не вважатиме задачу виконаною, — медіанний час становить близько 90 хвилин. Codex, натомість, зупиняється приблизно через півгодини майже незалежно від складності завдання. Згідно з дослідженням, та сама мовна модель у середньому робить у 2,5 раза більше кроків у Claude Code, ніж у Codex. Тобто тривалість роботи залежить не лише від самої моделі, а й значною мірою від того програмного оточення, у якому вона функціонує.

Агенти так само погано оцінюють якість власної роботи

Старіші моделі — Opus 4.8 та GPT-5.5 — у середньому завищували оцінку власних результатів на 20 пунктів і виставляли собі високі бали навіть за провальні завдання. В одному з випадків обидві моделі оцінили власну роботу приблизно на 70% успішності, тоді як реальні показники становили 7% і 14,5% відповідно.

Чому це важливо

Дослідники наголошують, що здатність до самооцінки має значення. Щоб агент міг надійно працювати над довготривалими завданнями, які тривають годинами, він має вміти виконувати інструкції на кшталт «попрацюй над цим завданням протягом двох годин». Агент, який постійно неправильно оцінює час, важко піддається контролю.

Далі автори планують перевірити, чи здатні агенти дотримуватися заданої тривалості роботи. Показово, що коли агентам надавали доступ до інструмента, який повідомляє про реальний перебіг часу, вони практично завжди давали правильну відповідь — тобто проблема не в принциповій нездатності орієнтуватись у часі, а саме у відсутності доступу до відповідної інформації за замовчуванням.

Нагадаємо, що Claude Opus 5 за один запит зібрав повноцінний шутер у стилі Call of Duty.

Головна > Новини > Штучний інтелект не відчуває часу — і навіть не підозрює про це

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *