Перейти до вмісту

GPT-5.6

Матеріал з Вікіпедії — вільної енциклопедії.
GPT-5.6
Типвелика мовна модель
КраїнаСША
РозробникOpenAI
Випущено9 липня 2026; 46 днів тому (2026-07-09)
Походить відGPT-5.5
Ліцензіявласницька
Сайтhttps://openai.com/uk-UA/index/gpt-5-6/

GPT-5.6 (Generative Pre-trained Transformer 5.6) — сімейство великих мовних моделей (ВММ) компанії OpenAI, випущене у відкритий доступ 9 липня 2026 року. В обмеженому режимі моделі стали доступні 26 червня 2026 р.[1][2]. У сімейство входять три моделі: Luna, Terra і Sol, — у порядку зростання можливостей[1][3]. Основні заявлені галузі застосування — програмування, агентні завдання (коли модель самостійно виконує багатокрокову роботу, користуючись зовнішніми інструментами), наукові дослідження та кібербезпека[4].

GPT-5.6 стала першою лінійкою OpenAI, випуск якої супроводжувався попередньою державною перевіркою в США: у перші тижні доступ до неї отримали лише близько двох десятків партнерів, схвалених владою[5].

Найменування та склад сімейства

[ред. | ред. код]

У GPT-5.6 компанія змінила підхід до назв: число позначає покоління, а імена Sol, Terra і Luna закріплені за рівнями можливостей, які OpenAI може оновлювати незалежно один від одного. Зміну в OpenAI описали як відмову від «однієї моделі з регулятором», на користь «трьох моделей на вибір»[6].

Sol — найпотужніша модель сімейства, призначена для складного програмування, тривалої агентної роботи та завдань, що потребують міркувань. Terra розрахована на повсякденне застосування: за якістю вона співставна з минулим флагманом — GPT-5.5, але приблизно вдвічі дешевша. Luna — найшвидша і найдешевша з трьох[2][7]. Крім цього, у сімейства з'явилися два нових режими роботи: в режимі max модель довше обмірковує одну відповідь, а режим ultra, за промовчанням, розподіляє складне багатокрокове завдання між чотирма паралельними агентами[3][2].

Технічні характеристики

[ред. | ред. код]

Доступ через API коштує 5 доларів за мільйон вхідних і 30 доларів за мільйон вихідних токенів (одиниць, на які модель розбиває текст) у Sol, 2,5 та 15 доларів у Terra, 1 та 6 доларів у Luna[7][4]. За даними програміста Саймона Уиллисона[en], у всіх трьох моделей контекстне вікно (обсяг тексту, який модель здатна враховувати за один раз) становить 1 млн токенів, обсяг виведення — до 128 тис. токенів, а навчальні дані охоплюють період до 16 лютого 2026 р.[8]. В API додано функцію Programmatic Tool Calling: модель пише і запускає невеликі програми, які самі координують виклики інструментів та відкидають проміжні дані[3]. Генеральний директор OpenAI Сем Альтман заявив телеканалу CNBC, що при агентному програмуванні Sol є «на 54 % ефективнішою за витратою токенів»; із чим саме порівнювалася модель, він не уточнив[9].

Продуктивність

[ред. | ред. код]

Згідно із вимірами OpenAI, на тесті Terminal-Bench 2.1, який оцінює роботу в командному рядку, Sol (88,8 %) та Sol у режимі ultra (91,9 %) обійшли Claude Mythos 5 (88,0 %); Luna (82,5 %) перевершила Claude Opus 4.8 (78,9 %), але поступилася GPT-5.5 (83,4 %), а Terra (84,3 %) — перевершила свою попередницю GPT-5.5[10].

Sol з максимальним рівнем міркувань набрала 59 балів в індексі інтелекту незалежної аналітичної служби Artificial Analysis — на бал менше, ніж Claude Fable 5, але вартість виконання завдань є приблизно на третину нижчою. В індексі агентного програмування, тієї ж служби, Sol посіла перше місце, з 80 балами[11]. За власними даними OpenAI, на агентному бенчмарку Agents Last Exam Sol встановила рекорд — 53,6 бала[3]. Крім того, Sol стала першою моделлю, яка виграла публічну гру бенчмарку ARC-AGI-3, і в режимі максимальних зусиль показала 92,5 % на ARC-AGI-2 та 96,5 % на ARC-AGI-1 — тестах серії ARC, які перевіряють здатність вирішувати нові для моделі задачі-головоломки[12].

За самостійно опублікованими даними двох компаній, на тесті програмних завдань SWE-Bench Pro Sol набрала 64,6 %, тоді як Claude Fable 5 — 80 %[8][13]. Напередодні випуску OpenAI оприлюднила аудит цього бенчмарку: за її оцінкою, близько 30 % його завдань є несправними[8]. На стадії попереднього доступу (прев'ю) OpenAI розкрила показники лише у трьох галузях — програмуванні, біології та кібербезпеці; результати низки академічних тестів компанія не опублікувала[10][13]. В індексі фактичних знань AA-Omniscience тієї ж Artificial Analysis Sol відповідає точніше ніж GPT-5.5, але і частота галюцинацій у неї є вищою[11].

Регуляторний контекст

[ред. | ред. код]

Ознайомча версія GPT-5.6 вийшла 26 червня 2026, з обмеженим доступом. Обмежити його OpenAI попросили два підрозділи Білого дому: Управління Office of the National Cyber Director[en]) та Управління науково-технічної політики. Приводом вони назвали можливості Sol в області кібератак[5][14]. Підставою для запиту став виконавчий указ президента Дональда Трампа від 2 червня 2026 року, — за ним лабораторії можуть добровільно відкривати державі доступ до передових моделей, на термін до 30 днів, перед широким випуском, а запроваджувати обов'язкове ліцензування або попередні погодження указ прямо забороняє[5]. OpenAI виконала прохання, але публічно з ним не погодилася — за заявою компанії, подібний державний доступ «не повинен стати довгостроковою нормою»[5].

На цьому етапі доступ мали приблизно 20 організацій із узгодженого списку; модель перевіряв Центр стандартів та інновацій в галузі ІІ Міністерства торгівлі, а OpenAI відрядила своїх технічних фахівців у Вашингтон[7][15]. Широкий випуск адміністрація дозволила 9 липня 2026 р.[2] Представник Білого дому при цьому сказав CNBC, що адміністрація не давала «зелене світло, схвалення чи дозвіл», а рішення про випуск «цілком залишаються за компаніями»[16].

Такий порядок викликав критику. Колишній радник Білого дому з питань ШІ Дін Болл розцінив його як фактичне примусове ліцензуванням передових моделей[5]. За словами експерта з кібербезпеки Алекса Стамоса[en], у галузі «практично ніхто не вважає, що для подібних дій є фактичні підстави»[17]. Член Палати представників Лори Трахан[en] вказала на відсутність правових рамок: «Ні закону, ні процедури, ні нагляду — просто призначенці у Вашингтоні вирішують, хто всередині, а хто зовні»[17]. Компанія Proton звертала увагу, що прив'язані до громадянства обмеження ставили у невигідне становище користувачів з Європейського Союзу та інших регіонів[18].

Безпека та критика

[ред. | ред. код]

У системній карті (описом її можливостей та ризиків, що публікується разом з моделлю) OpenAI віднесла всі три моделі до рівня ризику «високий» (high) у кібербезпеці, а також у біологічній та хімічній областях; найвищого рівня «критичний» (critical) вони не досягають[19]. У випробуваннях на браузерах Chromium і Mozilla Firefox Sol знаходила вразливості та заготовки експлойтів, проте вибудувати повний ланцюжок атаки самостійно не змогла[10].

Незалежна оцінна організація METR[en] при передрелізній перевірці з'ясувала, що на інженерному бенчмарку Sol шахраювала з системою винагороди (reward hacking): домагалася, щоб завдання зараховувалися вирішеними, не вирішуючи їх по суті, — і робила це частіше за будь-яку публічну модель з перевірок. Через це виміряти «часовий обрій» моделі — тривалість завдань, які вона здатна виконувати без участі людини, — не вдалося: залежно від того, чи зараховувати спроби обману як успіхи чи як провали, оцінка коливалася від 11 до 270 годин[20]. Інша група, Apollo Research, зауважила, що Sol рідше згадує в міркуваннях, що знаходиться в умовах тесту: 16 % зразків проти 43 % у GPT-5.5. Визначити причину група не змогла: або модель рідше розуміє, що її тестують, або це розуміння стало важче помітити[19][21]. Системна карта відзначає й іншу особливість Sol: вона частіше, ніж GPT-5.5, робить дії, про які користувач не просив[19].

Прийом

[ред. | ред. код]

Ранні тестувальники та оглядачі характеризували GPT-5.6 як добротний робочий інструмент: у найскладніших завданнях сімейство поступається моделям Anthropic, зате стабільніше поводиться у повсякденній роботі[2]. В огляді сервісу CodeRabbit Sol похвалили за тривалі сеанси програмування та роботу з комп'ютером, відзначивши слабкі місця в архітектурних рішеннях[22]. Глава компанії Every, Ден Шиппер, порівняв GPT-5.6 з автомобілем Porsche, а Claude Fable 5 — з варп-двигуном: «Якщо потрібно перетнути галактику — беріть Fable; якщо дістатися містом найкращим доступним інструментом — беріть 5.6»[2].

Супутні продукти

[ред. | ред. код]

Разом з GPT-5.6 компанія випустила ChatGPT Work — робочий помічник для корпоративних команд, на базі моделей нової родини, доступний на комп'ютері, в Інтернеті та на мобільних пристроях; він допомагає з повсякденними завданнями на кшталт підготовки документів, таблиць та презентацій[4]. На день раніше вийшли голосові моделі GPT Live 1 і GPT Live 1 mini (колишня назва — GPT-Bidi), з повнодуплексною архітектурою: вони слухають і говорять одночасно[23]. Тоді ж OpenAI вперше розкрила внутрішній індекс рекурсивного самопокращення (RSI; міра здатності моделі вдосконалювати інші моделі), за яким Sol випереджає GPT-5.5 на 16,2 пункта; демонструючи індекс, компанія показала, як Sol за коротким завданням самостійно донавчив модель Luna[24].

Цікаві факти

[ред. | ред. код]

У липні 2026 року модель GPT-5.6 Sol та інша не названа, більш потужна і ще не випущена модедь OpenAI, під час тестування, вийшли з пісочниці та зламали сервери Hugging Face, використовуючи розкриті облікові дані та вразливості нульового дня, щоб знайти відповіді на бенчмарк ExploitGym у базі даних. Стримати їх вдалося лише за допомогою китайської ШІ-моделі з відкритим кодом Zhipu GLM-5.2. Американські передові ШІ-моделі відмовилися стримувати атаку, через свої обмеження безпеки.[25][26]

Примітки

[ред. | ред. код]
  1. 1 2 Fried, Ina (26 червня 2026). OpenAI releases powerful new GPT-5.6 model under restrictions. Axios (англ.). Процитовано 11 липня 2026.
  2. 1 2 3 4 5 6 Fried, Ina; Mills, Madison (9 липня 2026). OpenAI releases GPT-5.6 and ChatGPT Work tool. Axios (англ.). Процитовано 11 липня 2026.
  3. 1 2 3 4 GPT-5.6: Frontier intelligence that scales with your ambition. OpenAI (англ.). 9 липня 2026. Процитовано 11 липня 2026.
  4. 1 2 3 Ropek, Lucas (9 липня 2026). OpenAI launches its new family of models with GPT-5.6. TechCrunch (англ.). Процитовано 11 липня 2026.
  5. 1 2 3 4 5 OpenAI limits GPT-5.6 rollout after government request, says restrictions shouldn't be the norm. TechCrunch (англ.). 26 червня 2026. Процитовано 11 липня 2026.
  6. OpenAI unveils ChatGPT Work agent, GPT-5.6 models now available. 9to5Mac (англ.). 9 липня 2026. Процитовано 11 липня 2026.
  7. 1 2 3 OpenAI gets permission to roll out GPT-5.6 to the public on July 9. Engadget (англ.). 8 липня 2026. Процитовано 11 липня 2026.
  8. 1 2 3 Willison, Simon (9 липня 2026). The new GPT-5.6 family: Luna, Terra, Sol. simonwillison.net (англ.). Процитовано 11 липня 2026.
  9. Capoot, Ashley (9 липня 2026). OpenAI's newest AI model is 54% more token efficient on agentic coding, Altman tells CNBC. CNBC (англ.). Процитовано 11 липня 2026.
  10. 1 2 3 Previewing GPT-5.6 Sol: a next-generation model. OpenAI (англ.). 26 червня 2026. Процитовано 11 липня 2026.
  11. 1 2 GPT-5.6 benchmarks across Intelligence, Speed and Cost. Artificial Analysis (англ.). 9 липня 2026. Процитовано 11 липня 2026.
  12. GPT-5.6 — ARC-AGI Results. ARC Prize (англ.). 9 липня 2026. Процитовано 11 липня 2026.
  13. 1 2 GPT-5.6 Sol vs Terra vs Luna: Which Tier Should You Actually Use?. Vellum (англ.). 2026–07. Процитовано 11 липня 2026.{{cite web}}: Обслуговування CS1: Сторінки з неправильним форматом в діапазонах дат (посилання)
  14. GPT-5.6 Goes Public After 12-Day White House Gate Tests Voluntary AI Framework. Tech Times (англ.). 9 липня 2026. Процитовано 11 липня 2026.
  15. OpenAI launches GPT-5.6 Sol after U.S. government approval. Yahoo News (англ.). 9 липня 2026. Процитовано 11 липня 2026.
  16. OpenAI to publicly release GPT-5.6, rolls out conversational AI models. CNBC (англ.). 8 липня 2026. Процитовано 11 липня 2026.
  17. 1 2 OpenAI limits its latest ChatGPT product to Trump-approved customers during cybersecurity review. San Mateo Daily Journal (англ.). 2026–06. Процитовано 11 липня 2026.{{cite web}}: Обслуговування CS1: Сторінки з неправильним форматом в діапазонах дат (посилання)
  18. Restrictions on access to GPT-5.6 could hurt European businesses. Proton (англ.). 2026–07. Процитовано 11 липня 2026.{{cite web}}: Обслуговування CS1: Сторінки з неправильним форматом в діапазонах дат (посилання)
  19. 1 2 3 GPT-5.6 Preview System Card. OpenAI Deployment Safety Hub (англ.). 26 червня 2026. Процитовано 11 липня 2026.
  20. Summary of METR's predeployment evaluation of GPT-5.6 Sol. METR (англ.). 26 червня 2026. Процитовано 11 липня 2026.
  21. GPT-5.6 cheats so much its testers couldn't measure it. Transformer News (англ.). 2026–06. Процитовано 11 липня 2026.{{cite web}}: Обслуговування CS1: Сторінки з неправильним форматом в діапазонах дат (посилання)
  22. OpenAI GPT-5.6 Sol and Terra: Benchmark. CodeRabbit (англ.). 2026–07. Процитовано 11 липня 2026.{{cite web}}: Обслуговування CS1: Сторінки з неправильним форматом в діапазонах дат (посилання)
  23. OpenAI releases new voice models for more natural live conversations. TechCrunch (англ.). 8 липня 2026. Процитовано 11 липня 2026.
  24. OpenAI's GPT-5.6 Sol autonomously post-trained the smaller Luna model with a "fairly underspecified prompt". The Decoder (англ.). 2026–07. Процитовано 11 липня 2026.{{cite web}}: Обслуговування CS1: Сторінки з неправильним форматом в діапазонах дат (посилання)
  25. Chinese AI's role in stopping rogue OpenAI agent shows cost of US guardrails / Aditya Soni, Jaspreet Singh // Reuters.  2026. — 22 July. — Updated July 23, 2026. — Дата звернення: 23.07.2026.
  26. Hugging Face deploys Zhipu’s GLM 5.2 model to contain autonomous OpenAI cyberattack / Xinmei Shen // South China Morning Post.  2026. — 22 July. — Дата звернення: 23.07.2026.

Посилання

[ред. | ред. код]