O'rin #2 Kundalik ekotizim — Yetakchi SI yordamchilari
OpenAI

GPT-6 Astra

GPT-6 Astra — OpenAI'ning chat oynasidan tashqarida kechadigan ishlar uchun mo'ljallangan yangi flagmani. U brauzerni boshqaradi, kompyuterdagi ilovalarni bosib harakatlantiradi, ko'p bosqichli professional ish jarayonlarini oxirigacha olib boradi va o'z faktlarini GPT-5.6 Sol'ga nisbatan taxminan ikki barobar yaxshiroq tekshiradi — barchasi sizga allaqachon tanish bo'lgan ChatGPT, Codex va API ekotizimi ichida.

Yangilangan 2026-yil 5-sentabr AgenticChatGPT WorkComputer Use
9.810 dan
Rasmiy veb-sayt
Eng mos

GPT-6 Astra — OpenAI'ning chat oynasidan tashqarida kechadigan ishlar uchun mo'ljallangan yangi flagmani. U brauzerni boshqaradi, kompyuterdagi ilovalarni bosib harakatlantiradi, ko'p bosqichli professional ish jarayonlarini oxirigacha olib boradi va o'z faktlarini GPT-5.6 Sol'ga nisbatan taxminan ikki barobar yaxshiroq tekshiradi — barchasi sizga allaqachon tanish bo'lgan ChatGPT, Codex va API ekotizimi ichida.

Nima uchun bu eng yaxshisi

Mustaqil Artificial Analysis sinovlari Astra'ga Intelligence Index bo'yicha 61,2 ball beradi — bu Sol bilan statistik durang degani. Shu bilan birga, rasmiy jadvallar kompyuterdan foydalanish bo'yicha OSWorld 2.0 testida 72,6% natijani (Sol'ga ketgan vaqtning yarmida), Agents' Last Exam bo'yicha 59,3%, ARC-AGI-3 standart sinov muhitida 62,7% (99,9% faqat OpenAI'ning o'z maxsus adapteri bilan), Terminal-Bench Science bo'yicha 64,6% natijani hamda yuqori aniqlik fonida gallyutsinatsiyalarning taxminan ikki barobar kamayganini ko'rsatadi. Birinchi kundanoq ChatGPT, Codex, API, Azure va Bedrock platformalarida mavjud.

E'tibor bering

Bu yangi IQ rekordi emas, balki ixtisoslashgan vositaning yangilanishidir. Mustaqil intellektual ish baholari (GDPval-AA) Sol'dan pastga tushdi, Claude Fable 5.1 esa keng qamrovli intellekt ko'rsatkichlarida hanuz yetakchi. API narxi Sol'dan 2,5 barobar yuqori: million token uchun $10/$50, keshdan o'qish esa $1. Astra'ning o'ta qisqa javoblari yuridik, moliyaviy va taqdimot sifatini tekshirishda o'z mavqeini boy berdi, dastlabki ishga tushirish jarayoni esa ba'zi to'lovchi foydalanuvchilarning kirishini cheklab qo'ydi.

01

Aslida bu nima

Har bir flagman model taqdimoti odatda bir xil shior bilan kutib olinadi: tarixdagi eng aqlli model. GPT-6 Astra’ning shiori esa boshqacha — va amaliy jihatdan ancha foydaliroq. U shunday deydi: bu safar klaviatura boshqaruvga o’tadi. Astra — OpenAI’ning oddiy chat doirasidan tashqaridagi ishlar uchun mo’ljallangan yangi flagmani: u brauzerni erkin boshqaradi, kompyuterdagi ilovalarni bosib harakatlantiradi, ko’p bosqichli murakkab professional jarayonlarni boshidan oxirigacha olib boradi — va bu ishlarni bajarish chog’ida o’z xulosalarini ancha ishonchli tekshiradi.

Amaliy sinov natijalari berilgan va’dalarga to’liq mos keladi. Kompyuter operatsiyalari sinovi bo’lgan OSWorld 2.0 testida Astra 72,6% natija qayd etdi va GPT-5.6 Sol’ga kerak bo’lgan qariyb 75 daqiqa o’rniga topshiriqlarni taxminan 40 daqiqada yakunladi; Opus 5 esa 70,2% natija ko’rsatgan. 55 xil soha bo’yicha uzoq davom etuvchi professional jarayonlarni baholovchi Agents’ Last Exam imtihonida u **59,3%**ga yetdi. Artificial Analysis’ning dalillar haqqoniyligi monitoringi esa Sol’ga qaraganda gallyutsinatsiya darajasi deyarli ikki barobar qisqarganini va yuqori aniqlik ta’minlanganini tasdiqlaydi. O’ziga ishongan xatolarning kamayishi va ishlarning ancha tez bitishi — bu dastlabki haftadanoq seziladigan real yangilanishdir.

Biroq hamma narsa mukammal emas va buni ochiq tan olish kerak. Artificial Analysis Intelligence Index reytingida Astra 61,2 ball oldi — bu Sol’ning 60,9 balli bilan statistik durang degani — ayni paytda Claude Fable 5.1 65,7 ball bilan peshqadamlik qilmoqda. Bilim talab qiluvchi GDPval-AA v2 sinovida Astra’ning taxminan 1629 ballik natijasi Opus 5 (1824), Fable 5.1 (1853) va hatto Sol’dan ham orqada. Agar kundalik ishingiz chuqur tahlil, hisobot tayyorlash va ekspert xulosasidan iborat bo’lsa, yangi flagman avtomatik ravishda eng yaxshi vositaga aylanib qolmaydi; u boshqa maqsadlar uchun yaratilgan. API narxi ham — million tokeniga $10/$50, Sol’dan 2,5 barobar yuqori, keshdan o’qish $1 — bu farqni yaqqol ko’rsatib turibdi.

Ishni to’g’ri yo’naltiring

Vazifa turi Kimga topshirish kerak Sababi
«Buni mening kompyuterimda bajar»: brauzer, fayllar, dasturlar bilan ishlash va oxiriga yetkazish Astra O’lchangan eng yaxshi kompyuter boshqaruvi, bitta topshiriqqa salkam ikki barobar tezroq
Mantiqiy xulosaga boy tahliliy ish, loyihalarni chuqur o’rganish, uzun hujjatlar Opus 5 API narxining to’rtdan biriga yuqori GDPval ko’rsatkichi
Eng murakkab sof fikrlash va chalkash, uzun kontekst bilan ishlash Fable 5 / Fable 5.1 Mustaqil intellektual reytinglarda mutlaq peshqadam
Katta hajmli oqim, oddiy qoralamalar, kundalik konveyer ishlari Sol / Terra / Luna Hanuz mavjud va bozordagi eng hamyonbop o’rinlar

Ochiq aytilishi lozim bo’lgan kamchiliklar

Astra tabiatan o’ta lo’nda va qisqa javob berishga moyil. Ushbu tezkor uslub dasturlash sinovlarida g’alaba keltiradi, biroq har bir qadamni batafsil sanab o’tishni rag’batlantiradigan huquqiy, moliyaviy va soliq mezonlarida o’z ustunligini yo’qotadi; tahlil sifati oshganiga qaramay, matnni sayqallab yetkazish Sol’ga nisbatan pasaygan. Birinchi kungi ishga tushirish jarayoni ancha tartibsiz kechdi — to’lovchi foydalanuvchilar kirish lotereyasiga duch keldi, Enterprise akkauntlarida esa Astra sukut bo’yicha o’chirilgan holda yetkazildi. Tizimda tasvir yaratish va audio yoki video chiqarish imkoniyati umuman yo’q. Uning ancha kuchaytirilgan kiberxavfsizlik qobiliyatlari (ExploitBench’da 100%, baholash jarayonida ilgari noma’lum bo’lgan 0-day zaifliklar aniqlangan) xavfsizlikka oid qonuniy ishlarni ham sekinlashtirishi mumkin bo’lgan qat’iy cheklovlar bilan taqdim etilgan.

Shunday qilib, eng maqbul yondashuv: boshqaruv ruli uchun Astra, ekspert xulosasi uchun Opus, chuqur fikrlash uchun Fable, uzluksiz konveyer uchun Sol. OpenAI bu safar kattaroq miya yaratmadi; u ancha chaqqon va mustahkam qo’llarni yaratdi. Ko’plab real amaliy ishlar uchun aynan mana shu o’zgarish hal qiluvchi ahamiyatga ega.

02

Kuchli tomonlar va halol cheklovlar

Asosiy afzalliklari

  • Ishni oxiriga yetkazadigan kompyuter boshqaruvi: Astra OSWorld 2.0 da 72,6% natija ko’rsatadi — Sol’da bu ko’rsatkich 65,7%, Opus 5’da 70,2%. Eng muhimi, u barcha topshiriqlar to’plamini Sol sarflagan qariyb 75 daqiqa o’rniga taxminan 40 daqiqada bajaradi. ChatGPT Work’da bu ish bitmaguncha saytlarni kezadigan, tugmalarni bosadigan, matn teradigan va fayllarni joyidan siljitadigan to’liq agentga aylanadi — siz esa faqat yakuniy tasdiqlovchi bo’lib qolasiz.
  • Taxminan ikki barobar kam gallyutsinatsiya: Artificial Analysis’ning dalillar haqqoniyligi monitoringi Astra’da xato to’qib chiqarish darajasi Sol’ga nisbatan qariyb yarmiga qisqarganini, umumiy aniqlik esa taxminan to’rt punktga oshganini ko’rsatadi. Professional amaliyotda o’ziga ishongan xatolarning kamayishi qo’shimcha imtihon ballidan ancha qimmatroq turadi.
  • Jiddiy ilmiy hamkor: Astra Terminal-Bench Science testida 64,6% qayd etdi — Fable 5.1’da 52,6%, Sol’da esa 22,4% — hamda FrontierMath Tier 4’da taxminan 97,6% natija ko’rsatdi. Baholash jarayonida u hatto Erdős’ning 68 ta ochiq matematik muammosidan ikkitasiga isbot keltirdi — bu tijoriy va’da emas, balki tadqiqot salohiyatining yorqin tasdig’idir.
  • Noma’lum muammolarni yechish kuchi: ARC-AGI-3 standart sinov muhitida Astra **62,7%**ga yetadi — bu Opus 5’ning 30,2%lik ko’rsatkichidan salkam ikki barobar yuqori. Internetda uchraydigan 99,9%lik raqam esa OpenAI’ning o’z maxsus adapteri va ma’lumotlarni siqishini talab qiladi; shu bois 62,7%ni xolis va taqqoslash mumkin bo’lgan real ko’rsatkich deb bilish lozim.
  • Ekotizim uzluksizligi: Astra birinchi kundanoq ChatGPT Work, Codex, desktop ilovasi va Sites bilan to’liq integratsiyalashgan. gpt-6-astra API identifikatori, Azure va Bedrock ro’yxatlari, mos keluvchi API loyihalari uchun Zero Data Retention kafolati, taxminan 1,05 million tokenlik kontekst oynasi hamda Devin kabi vositalarda birinchi kungi qo’llab-quvvatlov mavjud.

Haqiqiy cheklovlar

  • Umumiy intellektda keskin sakrash emas: Artificial Analysis Astra’ga 61,2, Sol’ga 60,9 ball beradi — bu deyarli teng natija; ayni paytda Claude Fable 5.1 65,7 ball bilan peshqadamlik qilmoqda. Intellektual ishga mo’ljallangan GDPval-AA v2 testida Astra’ning taxminan 1629 ballik natijasi Opus 5 (1824), Fable 5.1 (1853) va hatto Sol’dan ham orqada qoladi. Agar kundalik faoliyatingiz tahliliy xulosalar, hisobotlar tayyorlash va ekspert xulosasidan iborat bo’lsa, Astra avtomatik ravishda eng yaxshi tanlov bo’la olmaydi.
  • Qimmat iqtisodiy narx: API narxi million kirish/chiqish tokeni uchun $10/$50 — bu Sol’dan 2,5 barobar qimmat. Keshdan o’qish $1 (Fable 5.1 da bor-yo’g’i $0,25), keshga yozish $12,50, 272 ming tokendan ortiq buyruqlar uchun kirish narxi ikki barobar va tezkor rejimda (Fast mode) narx ikki hissa oshadi. Artificial Analysis hisob-kitoblariga ko’ra, Astra taxminan 10% kam token sarflasa-da, bitta intellektual topshiriq hisobida Sol’dan qariyb 75% qimmatroqqa tushadi.
  • Uslubdagi qisqalik va tizimga kirishdagi to’siqlar: Astra tabiatan o’ta lo’nda javob beradi, shu sababli huquq, moliya va soliq bo’yicha har bir qadamni batafsil tushuntirish talab qilinadigan mezonlarda ball yo’qotadi. Tahlil sifati oshgan bo’lsa-da, matnning taqdimot darajasi Sol’ga nisbatan pasaygan. Birinchi kungi ishga tushirish tartibsiz kechdi — korporativ (Enterprise) akkauntlarda Astra sukut bo’yicha o’chirilgan holda yetkazildi. Shuningdek, unda tasvir yaratish va audio/video chiqarish imkoniyati yo’q. Kuchaytirilgan kiberxavfsizlik himoyalari esa tizim xavfsizligini tekshirish bilan bog’liq qonuniy ishlarni ham sekinlashtirishi mumkin; OpenAI jadvallari esa e’lon qilingandan so’ng biroz o’zgardi, shuning uchun har bir katakni ±1–2 ball farq bilan baholang.
03

Benchmark natijalari

OSWorld 2.0 — Astra 72,6% taxminan 40 daqiqada

OpenAI'ning kompyuterdan foydalanish jadvali: Sol 65,7% (taxminan 75 daqiqa), Opus 5 esa 70,2%. Qisman, oflayn topshiriqlar to'plamida o'lchangan — bu kuchli yo'naltiruvchi ko'rsatkich, lekin sizning muayyan ilovalaringiz uchun kafolat emas.

Artificial Analysis Intelligence Index — 61,2

Mustaqil jamlama indeks: GPT-5.6 Sol bilan 60,9 ball natijasida teng, Claude Fable 5.1 dan (65,7) orqada. Asosiy xulosa — u «aqlliroq» emas, balki «ko'proq mustaqil harakat qiluvchi» agentdir.

AA faktuallik monitoringi — gallyutsinatsiyalar qariyb yarmiga kamaydi

Sol'ga nisbatan gallyutsinatsiya darajasi qariyb yarmiga tushgani va aniqlik to'rt punktga oshganini ko'rsatuvchi mustaqil o'lchov — professional mutaxassislar amalda his qiladigan asosiy ishonchlilik o'zgarishi.

ARC-AGI-3 — 62,7% standart / 99,9% provayder adapteri

Yangi interaktiv muammolarni yechish. 62,7% — standart sinov muhitining qiyosiy ko'rsatkichi (Opus 5: 30,2%); 99,9% esa OpenAI'ning Responses muhiti va siqish usulini o'z ichiga oladi hamda har doim ushbu izoh bilan ko'rsatilishi shart.

API narxlari — $10/$50 · keshdan o'qish $1 · yozish $12,50

Har 1 million kirish/chiqish tokeni uchun, qo'shimcha ravishda 272 ming tokendan ortiq buyruqlarga 2x kirish / 1,5x chiqish va tezkor rejimda 2x. Asosiy e'tiborni e'lon qilingan umumiy narxga emas, yakunlangan vazifa qiymati va kesh xususiyatlariga qarating.

04

Xulosa

GPT-6 Astra GPT-5.6 o’rnini egallab, kundalik ro’yxatimizda 2-o’ringa ko’tarildi. Chunki u eng ommabop iste’molchi platformasi — ChatGPT Work, Codex, desktop, Sites va API ichidagi kompyuterdan foydalanish va ilmiy vazifalar bo’yicha eng kuchli agentdir. Opus 5 sof intellektual mehnat uchun sarflangan har bir dollar hisobiga eng yuqori mantiqiy xulosa berish bo’yicha 1-o’rinni saqlab qolmoqda, Fable 5 esa chuqur intellekt mutaxassisi bo’lib qoladi. Vazifangiz «buni kompyuterimda mustaqil bajar va oxiriga yetkaz» bo’lsa, Astra’ni tanlang; natija sifatli ekspert xulosasi bo’lsa, Opus 5’ni oling; kundalik katta hajmli ishlarni eski arzon narxlarda Sol, Terra va Luna’ga yo’naltiring.

05

Ko'p so'raladigan savollar