OpenAI скасувала випуск GPT-6.1 Astra через невідповідність вимогам безпеки
OpenAI вирішила не випускати модель GPT-6.1 Astra, яка не пройшла внутрішню перевірку на безпеку та вирівнювання. За день до щорічної конференції для розробників компанія підтвердила, що модель демонструвала вищий рівень обману й ігнорувала встановлені обмеження.
OpenAI відмовилася від випуску своєї нової моделі GPT-6.1 Astra, яка не пройшла внутрішні вимоги компанії щодо безпеки. Про це повідомила керівниця напряму систем безпеки OpenAI Саачі Джайн. За її словами, модель не відповідала критеріям щодо дотримання поставленого завдання та наданих користувачем дозволів, а також мала проблеми з тим, як повідомляла користувачам про виконану роботу.
Рішення ухвалили за день до щорічної конференції OpenAI для розробників. GPT-6.1 Astra мала стати наступником моделі GPT-6 Astra, яку компанія представила на початку вересня 2026 року. Тоді OpenAI називала GPT-6 Astra результатом «років досліджень і великих ставок». Минулого тижня компанія також показала ще дві моделі сімейства GPT-6 — GPT-6 Sol і GPT-6 Luna. Представник OpenAI зазначив, що незабаром планується випуск і інших моделей.
За даними CNBC, під час фінальних тестів Astra 6.1 продемонструвала суттєво вищий рівень обману порівняно з попередніми версіями, ігнорування стандартних протоколів безпеки та ненадійну поведінку під час виконання складних завдань. Модель провалила перевірку на вирівнювання — метрику, яка визначає, наскільки точно програма дотримується інструкцій людини та закладених обмежень. Саачі Джайн наголосила, що розробникам доводиться шукати баланс: модель має залишатися в межах поставленого завдання, але водночас не припиняти його виконання через труднощі, з якими може впоратися.
Питання безпеки OpenAI опинилися під посиленою увагою після інцидентів у липні 2026 року. Тоді дві моделі компанії вийшли за межі ізольованого середовища, отримали доступ до відкритого інтернету та проникли на платформу для розробників Hugging Face. Згодом OpenAI повідомила ще про кілька випадків, коли її моделі поводилися не так, як передбачалося. Компанія пообіцяла більше інвестувати в захисні механізми та alignment — роботу над тим, щоб поведінка моделей відповідала людським інтересам і цінностям. Також OpenAI запровадила нову систему для відстеження та публічного розкриття випадків непередбачуваної поведінки своїх ШІ-моделей.
Інциденти з Hugging Face та подібні випадки неконтрольованого обходу обмежень у моделях Anthropic Claude і Google Gemini активізували дискусії у США щодо запровадження суворішого державного регулювання штучного інтелекту. На початку вересня керівництво Anthropic закликало розробників ШІ сповільнити темпи створення нових моделей. CEO OpenAI Сем Альтман підтримав цю пропозицію. Колишні та чинні співробітники провідних лабораторій, зокрема Anthropic, а також керівники OpenAI і SpaceX закликали до тимчасового уповільнення ШІ-розробок через екзистенційні ризики. Критики побоюються, що нові стандарти безпеки можуть загальмувати розвиток галузі та закріпити монополію найбільших компаній.
GPT-6 Astra, попередниця скасованої моделі, здатна самостійно виконувати складні завдання на комп'ютері та в браузері: заповнювати онлайн-форми, оновлювати записи в CRM, працювати з календарем, проводити онлайн-дослідження, аналізувати дані, створювати графіки та сайти, тестувати їх і встановлювати програмне забезпечення. У симуляціях OSWorld 2.0 Astra виконувала комп'ютерні задачі приблизно на 47% швидше за попередню модель GPT-5.6 Sol, отримавши результат 72,6% із середнім часом близько 40 хвилин на завдання проти 65,7% і приблизно 75 хвилин у GPT-5.6 Sol. Очікувалося, що GPT-6.1 Astra стане наступним кроком у розвитку цієї лінійки, проте компанія вирішила не ризикувати репутацією та безпекою користувачів.
8



