Agenci AI źle szacują czas zadań. Ich szacunki mogą być zawyżone nawet dziesięciokrotnie
Badania nad testowanymi agentami opartymi na modelach językowych pokazują, że ich szacunki czasu mogą mocno rozmijać się z rzeczywistym wykonaniem. W badanych ustawieniach błędy sięgały nawet około 10-krotności rzeczywistego czasu zadania.
Badania nad testowanymi agentami opartymi na modelach językowych pokazują, że ich szacunki czasu mogą mocno rozmijać się z rzeczywistym wykonaniem. W badanych ustawieniach błędy sięgały nawet około 10-krotności rzeczywistego czasu zadania.
Co pokazują wyniki?
W testach asystentów kodowania Claude Code i Codex modele systematycznie zawyżały czas potrzebny na wykonanie zadań. W badanym środowisku błędy Codex sięgały nawet około 10-krotności rzeczywistego czasu wykonania.
Wielostopniowe zadania także sprawiają problem
W niezależnym badaniu dotyczącym wieloetapowych ustawień agentowych szacunki czasu przed rozpoczęciem zadania odbiegały od rzeczywistego wykonania od 5 do 10 razy.
Znaczniki czasu nie rozwiązują problemu
W badaniu obejmującym 76 scenariuszy żaden z ocenianych agentów nie przekroczył 65% znormalizowanej zgodności z ludzkimi preferencjami czasowymi, nawet gdy otrzymywał znaczniki czasu.
Co to oznacza dla automatyzacji?
W praktyce szacunki czasu podawane przez agenta warto traktować jako orientacyjne. Przy dłuższych autonomicznych zadaniach sensowne jest korzystanie z zewnętrznego pomiaru czasu, punktów kontrolnych i limitów wykonania zamiast polegania wyłącznie na deklaracji modelu.
Źródła: Your Agents Are Not Time Aware, Can LLMs Perceive Time? An Empirical Investigation, Your LLM Agents are Temporally Blind
Artykuł źródłowy: the-decoder.com
Masz podobny temat w firmie?
Jeśli dany wpis dotyka procesu, danych albo wdrożenia, które widzisz u siebie, lepiej zacząć od krótkiej diagnozy niż od gonienia za kolejną modną funkcją AI.
Semantycznie powiązane materiały
