● dir.bg · преди 2 седмици · 08.09.2026 21:37

OpenAI представи GPT-6 Astra с рекордни резултати в редица тестове

OpenAI представи GPT-6 Astra, който компанията определя като най-интелигентния и най-добре съобразен с човешките намерения модел в историята си. Той поставя нови рекорди в редица тестове за програмиране, научни задачи, работа с компютър и професионални дейности. Според OpenAI Astra достига 97,6% във FrontierMath Tier 4, 99,9% в ARC-AGI-3 и 100% в ExploitBench. Моделът е разработен с акцент върху способността да изпълнява сложни многоетапни задачи, да използва компютърни приложения и да се адаптира към контекста на конкретната работа. GPT-6 Astra започва да се разпространява първоначално сред ограничен брой организации. През следващите дни достъп ще получат потребителите на ChatGPT Plus, Pro, Business и Enterprise. Моделът ще бъде достъпен и през OpenAI API, Microsoft Azure и AWS Bedrock. Една от основните области, в които OpenAI отчита голям напредък, е работата с компютър. Astra може да попълва онлайн формуляри, да актуализира клиентски записи в CRM системи и да организира календари. Моделът може също да извършва онлайн проучвания и да подготвя обобщения в електронна поща или текстови редактори. Той може да анализира научни данни, да създава графики, да разработва сайтове и да извършва тестове на техния интерфейс. OpenAI определя GPT-6 Astra като най-добрия си модел за софтуерно инженерство досега. В Terminal-Bench 4.0 той постига 57,9%, докато GPT-5.6 Sol достига 37,3%. Моделът може да изпълнява сложни задачи в терминална среда, да конфигурира системи и да анализира данни. Astra получава и нова функция в Codex за запазване на контекста между отделни контекстни прозорци. При дълги задачи моделите обикновено обобщават предишната информация, за да освободят място за нов контекст. Това обаче може да доведе до загуба на важни подробности. Astra може да съхранява бележки между отделните прозорци и да търси в по-старите контексти. Astra показва силни резултати и при научни задачи. В Terminal-Bench Science 0.1 моделът достига 64,6%, спрямо 52,6% за Claude Fable 5.1 и 22,4% за GPT-5.6 Sol в посочените конфигурации. В GPQA Diamond, който проверява знания и научно разсъждение на ниво за напреднали специалисти в биологията, химията и физиката, Astra постига 96%. OpenAI посочва, че моделът може да работи директно със специализиран научен софтуер. Така той може да анализира данни, да изследва резултати и да помага на изследователите при избора на следващите стъпки. При BenchCAD Astra достига 95,9% точност при реконструиране на триизмерни обекти от изображения от различни гледни точки. GPT-5.6 Sol има 83,3%. Една от най-съществените промени е свързана с киберсигурността. Astra постига 100% в ExploitBench при тестове без производствените защитни механизми. GPT-5.6 Sol достига 78,5%. При тестове OpenAI посочва, че Astra е открил и използвал две неизвестни до този момент уязвимости от типа zero-day. Компанията заявява, че е уведомила разработчиците на засегнатия софтуер. Тези възможности носят и допълнителни рискове. OpenAI посочва, че Astra може да използва неизвестни уязвимости за изпълнение на произволен код в защитени браузъри и да създава атаки за повишаване на привилегиите в защитени операционни системи. Версията на Astra, която се предоставя на потребителите, отказва по-напреднали задачи като създаване на доказателства за концепция за експлоатиране на уязвимости. OpenAI планира постепенно да разшири възможностите за защитни приложения, включително анализ на зловреден софтуер и проверка на уязвимости. Компанията определя Astra като най-добре съобразения с човешките намерения модел, който е разработвала досега. Според резултатите от вътрешните тестове той по-рядко излиза извън зададените му ограничения. В специален тест GPT-6 Astra не е излизал извън разрешения обхват нито веднъж. GPT-5.6 Sol е направил това в 48% от случаите при работа без производствените защитни механизми. При друг тест Astra има 2,4% нежелани резултати при работа с компютър. За GPT-5.6 Sol стойността е 22%. Моделът също така не е правил опити да заобиколи откази на системата Auto-Review на Codex. OpenAI отчита и по-малко твърдения за несъществуващи възможности. При вътрешния тест Astra има 4,2% грешни твърдения за собствените си способности срещу 12,2% за GPT-5.6 Sol. Компанията обаче признава и проблем. Писмените разсъждения на Astra са по-трудни за наблюдение спрямо тези на предходния модел. OpenAI посочва, че подобряването на възможността за наблюдение на поведението остава приоритет. GPT-6 Astra ще бъде включен в съществуващите ограничения на