Microsoftovi výzkumníci uvádějí, že modely umělé inteligence ještě nejsou schopny řešit složité úkoly.

Microsoftovi výzkumníci uvádějí, že modely umělé inteligence ještě nejsou schopny řešit složité úkoly.

23 hardware

Microsoft‑výzkumníci odhalili omezení současných velkých jazykových modelů (LLM) při provádění složitých opakovaných úkolů

V rámci experimentů Microsoft Research zjistili, že i ty nejpokročilejší AI‑modely dělají vážné chyby, když jim přidělují dlouhé a vícenásobné operace. Mezi testovanými systémy – Gemini 3.1 Pro, Claude 4.6 Opus a GPT 5.4 – průměrně každá ztratila asi 25 % obsahu dokumentů po autonomní obsluze.

Co konkrétně testovali
* Benchmark DELEGATE‑52

Vytvořený týmem Philipa Labana, Tobiasu Schnabelem a Jennifer Nevill. Modeluje pracovní procesy v 52 profesních oblastech: od programování a notace až po krystalografii.

* Kritérium hodnocení

Modely byly hodnoceny podle toho, jak zachovávají integritu dokumentu po 20 cyklech zpracování. Práh „připravenosti“ byl nastaven na úroveň 98 % – pokud výsledek klesl pod tuto hranici, úkol se považoval za neúspěšný.

Klíčové závěry
OblastNejlepší výsledkyProgramováníNejvětší výkonPřírodní jazykNejméně spolehlivé modely
* Pokles kvality

Ve více než 80 % kombinací dokumentů klesla kvalita na 80 % a méně. Nejlepší model (Gemini 3.1 Pro) splňoval kritéria připravenosti pouze v 11 z 52 oblastí.

* Skokové chyby

Ztráty se nevyskytovaly postupně, ale „skoky“: během jednoho cyklu interakce mohl model ztratit od 10 do 30 % přesnosti. Pokročilejší modely (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) se snažily vyhnout drobným chybám tím, že je odkládaly na pozdější fáze a snižovaly počet interakcí.

* Agentní řízení

Při používání nástrojů v režimu agentního řízení se výsledky nezlepšily: k konci cyklu kvalita klesala přibližně o 6 %.

Co to znamená pro uživatele
Vědci zdůrazňují, že uživatelé stále musí pečlivě kontrolovat práci AI‑systémů při delegování pravomocí. Současné modely jsou schopny pracovat autonomně pouze v úzkých oblastech.

Nicméně autoři benchmarku uvádějí zřetelný pokrok: rodina modelů OpenAI za 16 měsíců zlepšila výkonnostní ukazatele z 14,7 % na 71,5 %. To potvrzuje, že LLM se stále vyvíjejí, ale zatím zůstávají omezené v složitých opakovaných úkolech.

Komentáře (0)

Podělte se o svůj názor — prosím, buďte slušní a držte se tématu.

Zatím žádné komentáře. Zanechte komentář a podělte se o svůj názor!

Chcete-li zanechat komentář, přihlaste se.

Přihlaste se pro komentování