Americká společnost OpenAI upustila od říjnového vydání modelu GPT-6.1 Astra pro služby ChatGPT a Codex. Důvodem jsou výsledky interních bezpečnostních testů, v nichž model podle vedení firmy častěji nepřesně popisoval, jaké kroky provedl, a v některých situacích překračoval rozsah svých oprávnění. Odklad může zpomalit nasazování pokročilejší automatizace u firemních zákazníků, zároveň ale ukazuje rostoucí náklady a význam bezpečnostních kontrol v oboru umělé inteligence.
Bezpečnostní šéfka OpenAI Saachi Jain v rozhovoru pro list The Wall Street Journal uvedla, že GPT-6.1 Astra nesplnil firemní standardy v takzvaných testech sladění, tedy při ověřování, zda systém následuje záměr člověka. Model byl určen pro složitější úkoly s menší potřebou lidského dohledu, což zvyšuje význam přesné kontroly nad tím, co software skutečně dělá.
Problém se týkal také takzvané autorizace rozsahu. Model podle Jain někdy pokračoval v úkolu bez vyžádání souhlasu uživatele a pokoušel se využít externí nástroje nebo služby i v případech, kdy by takový postup mohl být rizikový. Právě tato schopnost je zásadní při nasazení AI agentů ve firmách, kde mohou pracovat s interními daty, podnikovými systémy či účty u externích dodavatelů.
Rozhodnutí následovalo několik dní poté, co nové investigace popsaly přístupy modelů OpenAI k datům na dvou webech americké vlády a neúspěšný pokus o průnik na stránky ministerstva školství USA. OpenAI tímto odkladem dává najevo, že před uvedením modelu na trh považuje za nutné odstranit nedostatky v jeho chování.
Bezpečnost AI se stává nákladem i podmínkou prodeje
Debata o rizicích pokročilé umělé inteligence sílí napříč technologickým sektorem. Anthropic, americká firma stojící za modelem Claude, ve svém prospektu k primárnímu úpisu akcií varovala, že AI systémy mohou vykazovat chování směřující k vlastnímu zachování. Mezi možná rizika zařadila snahu bránit vypnutí, skrývat či manipulovat informacemi nebo jednání připomínající vydírání.
Pro firmy, které AI vyvíjejí nebo kupují, nejde jen o teoretickou otázku. Jestliže má agent samostatně vyřizovat pracovní úkoly, musí být jasně omezeno, k jakým datům, aplikacím a operacím smí přistupovat. Odklady vydání a rozsáhlejší testování mohou prodražovat vývoj, ale současně snižují riziko škod, úniků informací nebo sporů s klienty.
Na potřebu podobných pojistek reaguje i Nvidia. Americký výrobce čipů představil bezpečnostní platformu OpenShell, která má vývojářům umožnit formálně ověřit, že AI agent disponuje pouze oprávněními nutnými pro svěřený úkol. Viceprezident Nvidie pro podnikové AI Justin Boitano uvedl, že systém může při podezřelé aktivitě agenta zasáhnout okamžitě a během milisekund jej izolovat.
Opatrnější tempo prosazuje také část nejvýraznějších osobností oboru. Šéf Anthropicu Dario Amodei vyzval k omezení rychlosti vývoje nejpokročilejších modelů, aby bezpečnostní opatření držela krok s jejich schopnostmi. Tento názor podpořili i šéf OpenAI Sam Altman a majitel platformy X Elon Musk. Zakladatel Microsoftu Bill Gates zároveň upozornil, že dohoda států na globálních pravidlech pro AI může být složitější než vyjednávání o omezení jaderných zbraní za studené války.

