Claude Mythos je potvrzen testy jako vůdce v odhalování zranitelností, avšak projevuje i další nedostatky

Claude Mythos je potvrzen testy jako vůdce v odhalování zranitelností, avšak projevuje i další nedostatky

28 hardware

Krátké shrnutí

Společnost XBOW provedla nezávislé hodnocení AI modelu Mythos Preview od Anthropic. Výsledky ukázaly, že model převyšuje stávající ekvivalenty při vyhledávání zranitelností v zdrojovém kódu a při práci s nativním kódem a reverzním inženýrstvím, ale projevuje slabosti při analýze izolovaného kódu a potvrzení praktické použitelnosti nalezených exploitů. Náklady na provoz modelu zůstávají otázkou: Mythos je dražší než Opus, avšak při omezeném rozpočtu tokenů někdy demonstruje lepší přesnost.

1. Co XBOW testovala
- Rozsah testů – série nezávislých experimentů s Mythos Preview.
- Scénáře – audit fungujících systémů s přístupem ke zdrojovému kódu, analýza izolovaného kódu, reverzní inženýrství a interakce s grafickým rozhraním.

2. Klíčové závěry
| Ukazatel | Mythos Preview | Opačné modely |
|---|---|---|
| Detekce zranitelností | Nejlepší výsledek mezi všemi modely, zejména v zdrojovém kódu a nativním programování. | Méně přesný, ale někdy spolehlivější při ověřování konkrétních případů. |
| Odstranění falešných alarmů | Odstraňuje více „falešných“ nálezů než předchůdci. | Často generuje více falešných alarmů. |
| Problémy s izolovaným kódem | Model lépe zvládá situace bez kontextu systému. | Některé modely fungují lépe při řádkové analýze. |
| Potvrzení exploitů | Má tendenci k doslovnému přístupu, někdy přeceňuje praktickou hodnotu nálezů. | Kritičtější vůči reálné použitelnosti. |
| Reverzní inženýrství a nativní kód | Dosahuje silných výsledků; dobře „rozumí“ logice programu bez zdrojového kódu. | Méně přesný v těchto úlohách. |
| Interakce s UI | Někdy nepřesně najde souřadnice prvků, ale úspěšně určuje potřebné akce v prohlížeči. | Některé modely jsou přesnější při pozicování. |

3. Náklady a efektivita
- Cenové nastavení – Anthropic uvádí, že Mythos bude stát pětkrát více než Opus.
- Ekonomická analýza – XBOW provedla experimenty s „levnými“ modely, které jim poskytly více času na práci. Výsledky ukázaly, že při normalizaci podle nákladů se práce Mythos Preview nezdá být zbytečná pro úkoly vysoké přesnosti.
- Benchmarky – Na pevně stanoveném rozpočtu tokenů převyšuje Mythos Opus 4.6 v hledání webových zranitelností, ale ustupuje GPT5.5.

4. Shrnutí
Mythos Preview ukazuje výjimečnou sílu při auditu zdrojového kódu a nativních programů, stejně jako v úlohách reverzního inženýrství a analýzy webových aplikací. Model však někdy podceňuje reálnou použitelnost nalezených zranitelností a projevuje slabosti v izolované analýze kódu. Při omezených zdrojích tokenů může být Mythos výhodnější než Opus, ale při plném rozpočtu zůstává GPT5.5 konkurentem.

Závěr XBOW: Mythos Preview je spolehlivý nástroj pro odhalování potenciálních zranitelností v zdrojovém kódu a složitých systémech, avšak vyžaduje dodatečné potvrzení praktické hodnoty nalezených exploitů.

Komentáře (0)

Podělte se o svůj názor — prosím, buďte slušní a držte se tématu.

Zatím žádné komentáře. Zanechte komentář a podělte se o svůj názor!

Chcete-li zanechat komentář, přihlaste se.

Přihlaste se pro komentování