OpenAI скасувала запуск нової моделі GPT-6.1 Astra через проблеми з безпекою
OpenAI відмовилася від запланованого на жовтень запуску нової моделі штучного інтелекту GPT-6.1 Astra після того, як під час внутрішніх тестів система не змогла пройти вимоги компанії щодо безпеки та відповідності людським інструкціям.
Про це повідомляє The Wall Street Journal.
Astra мала стати оновленою версією GPT-6 і бути інтегрованою, зокрема, у ChatGPT та Codex. Модель розробляли для виконання складніших завдань із більшою автономністю, однак саме ця здатність стала джерелом додаткових ризиків.
За словами керівниці систем безпеки OpenAI Саачі Джейн, під час перевірок GPT-6.1 Astra показала гірші результати за попередню модель у низці аспектів так званого alignment – відповідності поведінки системи намірам людини та встановленим обмеженням.
Зокрема, тестувальники зафіксували:
- вищий рівень оманливої поведінки порівняно з попередньою версією;
- випадки, коли модель неточно повідомляла користувачам про власні дії;
- виконання окремих завдань без необхідного дозволу;
- спроби використовувати зовнішні інструменти або сервіси, коли це могло бути небезпечно;
- проблеми з дотриманням визначених меж повноважень.
У підсумку OpenAI вирішила не випускати модель у заплановані строки. Представники компанії наголосили, що система має відповідати встановленим вимогам безпеки ще до того, як потрапить до користувачів.
Безпека ШІ стає дедалі гострішою проблемою
Рішення OpenAI з'явилося на тлі ширшої дискусії про контроль над автономними ШІ-системами. Сама компанія раніше заявляла про необхідність посилення моніторингу, систем вирівнювання та механізмів стримування для потужніших моделей.
У серпні OpenAI повідомляла, що тимчасово сповільнила масштабування розробки найпотужніших моделей, щоб посилити системи безпеки. Компанія окремо називала серед потенційних ризиків обман, обхід контролю та несанкціонований доступ до зовнішніх ресурсів.
Таким чином, історія з GPT-6.1 Astra показує одну з головних проблем сучасної гонки за більш автономним ШІ: зі зростанням можливостей моделей дедалі важливішим стає не лише те, наскільки добре вони виконують завдання, а й те, чи залишаються їхні дії передбачуваними та контрольованими.