Microsoftovi výzkumníci uvádějí, že modely umělé inteligence ještě nejsou schopny řešit složité úkoly.
Microsoft‑výzkumníci odhalili omezení současných velkých jazykových modelů (LLM) při provádění složitých opakovaných úkolů
V rámci experimentů Microsoft Research zjistili, že i ty nejpokročilejší AI‑modely dělají vážné chyby, když jim přidělují dlouhé a vícenásobné operace. Mezi testovanými systémy – Gemini 3.1 Pro, Claude 4.6 Opus a GPT 5.4 – průměrně každá ztratila asi 25 % obsahu dokumentů po autonomní obsluze.
Co konkrétně testovali
* Benchmark DELEGATE‑52
Vytvořený týmem Philipa Labana, Tobiasu Schnabelem a Jennifer Nevill. Modeluje pracovní procesy v 52 profesních oblastech: od programování a notace až po krystalografii.
* Kritérium hodnocení
Modely byly hodnoceny podle toho, jak zachovávají integritu dokumentu po 20 cyklech zpracování. Práh „připravenosti“ byl nastaven na úroveň 98 % – pokud výsledek klesl pod tuto hranici, úkol se považoval za neúspěšný.
Klíčové závěry
OblastNejlepší výsledkyProgramováníNejvětší výkonPřírodní jazykNejméně spolehlivé modely
* Pokles kvality
Ve více než 80 % kombinací dokumentů klesla kvalita na 80 % a méně. Nejlepší model (Gemini 3.1 Pro) splňoval kritéria připravenosti pouze v 11 z 52 oblastí.
* Skokové chyby
Ztráty se nevyskytovaly postupně, ale „skoky“: během jednoho cyklu interakce mohl model ztratit od 10 do 30 % přesnosti. Pokročilejší modely (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) se snažily vyhnout drobným chybám tím, že je odkládaly na pozdější fáze a snižovaly počet interakcí.
* Agentní řízení
Při používání nástrojů v režimu agentního řízení se výsledky nezlepšily: k konci cyklu kvalita klesala přibližně o 6 %.
Co to znamená pro uživatele
Vědci zdůrazňují, že uživatelé stále musí pečlivě kontrolovat práci AI‑systémů při delegování pravomocí. Současné modely jsou schopny pracovat autonomně pouze v úzkých oblastech.
Nicméně autoři benchmarku uvádějí zřetelný pokrok: rodina modelů OpenAI za 16 měsíců zlepšila výkonnostní ukazatele z 14,7 % na 71,5 %. To potvrzuje, že LLM se stále vyvíjejí, ale zatím zůstávají omezené v složitých opakovaných úkolech.
Komentáře (0)
Podělte se o svůj názor — prosím, buďte slušní a držte se tématu.
Přihlaste se pro komentování