Predstavljeni GPT-6 Sol i GPT-6 Luna: Nova era pristupačne i snažne umjetne inteligencije

Predstavljeni GPT-6 Sol i GPT-6 Luna Nova era pristupačne i snažne umjetne inteligencije

Revolucija u svijetu umjetne inteligencije: Predstavljeni GPT-6 Sol i GPT-6 Luna

Ranije ovog mjeseca, svijet je svjedočio predstavljanju modela GPT‑6 Astra, koji je okrunjen titulom najinteligentnijeg i najusklađenijeg modela na svijetu. Iako najzahtjevniji i najvažniji projekti i dalje zahtijevaju punu dubinu Astre, rad se odvija u različitim mjerilima, ritmovima i budžetima. Kao odgovor na te potrebe, proširuje se GPT‑6 svemir s dva nova modela: GPT‑6 Sol i GPT‑6 Luna. Ovi modeli ne samo da nasljeđuju napredak iz Astre, već ga čine dostupnijim kroz značajno unaprijeđenu isplativost.

Unapređenje isplativosti uz zadržavanje performansi

Modeli GPT‑6 Sol i GPT‑6 Luna trenirani su sličnim metodama kao i GPT‑6 Astra, prenoseći napredak u performansama na profesionalnim zadacima, faktografiji, kodiranju, korištenju računala i usklađenosti na brže i pristupačnije modele. Kombinirajući iznimne mogućnosti na svim razinama s infrastrukturom koja ih učinkovito isporučuje u velikim razmjerima, ovi novi modeli predvode u pogledu omjera cijene i inteligencije.

Unapređenja u predmemoriranju (caching) i inferenciji omogućila su smanjenje troškova posluživanja ovih modela. Te uštede izravno se prenose na korisnike i kupce kroz smanjenje cijena API-ja za Sol i Luna za 50% u odnosu na njihove promotivne cijene iz GPT-5.6 ere. Ova poboljšanja čine naprednu umjetnu inteligenciju praktičnom za više svakodnevnih zadataka i aplikacija u velikom opsegu.

Pregled cijena API-ja za GPT-6 modele

Detaljni pregled cijena po milijun tokena:

  • GPT-5.6 Sol → GPT-6 Sol: Ulazne cijene snižene s $4 na $2, izlazne s $20 na $10. Smanjenje od 50%.
  • GPT-5.6 Luna → GPT-6 Luna: Ulazne cijene snižene s $0.20 na $0.10, izlazne s $1.20 na $0.50. Smanjenje od 50%.

GPT‑6 Astra i dalje ostaje naš najbolji model u svim segmentima, idealan za one koji teže vrhunskim rezultatima bez kompromisa.

Korak naprijed u cijeloj obitelji modela

GPT‑6 Sol i Luna donose nadogradnje inteligencije i isplativosti modelima koje već koristite, s fokusom na sposobnosti ključne za obavljanje složenih poslova.

Profesionalni rad

GPT‑6 Sol sposoban je preuzeti zahtjevne radne zadatke, nudeći veće limite korištenja i niže troškove, čime pruža više inteligencije i bolje rezultate u usporedbi sa konkurentskim modelima slične cijene. Na benchmarku AutomationBench, koji testira poslovne radne procese, GPT‑6 Sol pri visokom naporu (xhigh effort) nadmašuje Claude Opus 5 pri maksimalnom naporu, i to za samo 9% cijene po zadatku koju naplaćuje Opus 5. Pri standardnom visokom naporu (high effort), GPT‑6 Luna poboljšava performanse prethodnika za 5.4 postotna boda uz 58% nižu cijenu po zadatku.

Grafikon koji prikazuje rezultat u odnosu na cijenu po zadatku za šest različitih modela, uključujući GPT-6 Astra, GPT-6 Sol, GPT-5.6 Sol, GPT-6 Luna, GPT-5.6 Luna, Claude Opus 5 i Claude Fable 5.1 s Opus 5 fallback

GPT‑6 Sol također nadmašuje Claude Fable 5.1 uz znatno nižu cijenu, te čak i nadmašuje GPT‑6 Astra pri niskoj razini napora. U usporedbi na AutomationBench:

  • GPT‑6 Sol (xhigh effort): 33.2% rezultata, cijena po zadatku $0.27
  • GPT‑6 Astra (low effort): 30.3% rezultata, 3.9x skuplji od GPT‑6 Sol
  • Claude Opus 5 (max effort): 26.9% rezultata, 11.1x skuplji od GPT‑6 Sol
  • Claude Fable 5.1 w/ Opus 5 Fallback (max effort): 31.4% rezultata, preko 8.9x skuplji od GPT‑6 Sol

Na benchmarku Agents’ Last Exam, koji procjenjuje agente na složenim profesionalnim radnim procesima, GPT‑6 Sol pri maksimalnom naporu postiže 56.4%, nadmašujući najviši rezultat Claude Opus 5 (60%) uz 60% nižu cijenu po zadatku.

Grafikon koji prikazuje rezultat naspram troška po zadatku za različite jezične modele, uključujući GPT-6 Astra, GPT-6 Sol, GPT-5.6 Sol, GPT-6 Luna, GPT-5.6 Luna, Claude Opus 5 i Claude Fable 5

Faktografska točnost

Korisnost odgovora ovisi o faktografskoj točnosti. GPT‑6 Sol čini otprilike upola manje pogrešaka nego njegov prethodnik, približavajući se pouzdanosti Astre uz znatno nižu cijenu. GPT‑6 Luna također pokazuje značajno poboljšanje; pri višim razinama napora podudara se s GPT‑5.6 Sol uz stoti dio cijene.

Grafički prikaz pogrešaka na zadanim upitima:

  • GPT-6 Astra
  • GPT-6 Sol
  • GPT-5.6 Sol
  • GPT-6 Luna
  • GPT-5.6 Luna

Ova evaluacija faktografije temelji se na anonimiziranim razgovorima gdje su korisnici označili pogreške modela. Iako ove situacije namjerno testiraju izazovna područja, pogreške su rjeđe u tipičnoj upotrebi.

Stopa faktualnih pogrešaka u teškim upitima za GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, GPT-5.6 Sol i GPT-5.6 Luna u odnosu na cijenu po zadatku

Kodiranje

GPT‑6 Sol i Luna kombiniraju snažne performanse kodiranja s nižim API cijenama, dajući programerima više prostora za iteracije i timovima samopouzdanje za ambicioznije projekte. Na benchmarku FrontierCode, koji ocjenjuje jesu li promjene koda spremne za integraciju u stvarne kodne baze, GPT‑6 Sol pokazuje značajno poboljšanje u odnosu na GPT‑5.6 Sol te može parirati Claude Fable 5.1 xhigh uz znatno nižu cijenu.

Grafikon prikazuje ocjenu (Score) u odnosu na cijenu po zadatku (Cost per task) za različite modele: GPT-4 Astra, GPT-4 Sol, GPT-4 Luna, Claude Opus 5, GPT-4.5 Sol i Claude Fable 5.1

Na benchmarku DeepSWE v1.1, koji testira performanse na složenim zadacima softverskog inženjerstva u stvarnim kodnim bazama, GPT‑6 Sol pri maksimalnom naporu postiže 68.8%, unutar 1.1 postotnog boda od najvišeg rezultata Claude Fable 5 (69.9% pri xhigh naporu), i to uz otprilike 80% nižu cijenu po zadatku. GPT‑6 Luna pri maksimalnom naporu postiže 66.6%, usporedivo s Claude Opus 5 i Fable 5 pri srednjem naporu, koštajući pritom 93% manje od Opus 5 i 96% manje od Fable 5.

Graf koji prikazuje rezultat u odnosu na cijenu po zadatku za različite GPT i Claude modele

Korištenje računala

Iako GPT‑6 Astra ostaje najbolji model za korištenje računala, GPT‑6 Sol i Luna nude isplativije performanse od svojih prethodnika. Na benchmarku OSWorld 2.0 offline, GPT‑6 Sol pri xhigh naporu postiže sličan rezultat kao Claude Opus 5 pri srednjem naporu (60.5% naspram 60.3%), uz otprilike 80% nižu cijenu po zadatku. GPT‑6 Luna (max) nadmašuje GPT‑5.6 Sol (medium) za desetinu cijene.

Grafikon koji prikazuje rezultat prema cijeni po zadatku za modele GPT-6 Astra, GPT-6 Sol, GPT-5.6 Sol, GPT-6 Luna, GPT-5.6 Luna i Claude Opus 5

Stil suradnje i poboljšanja predmemoriranja

GPT‑6 Astra-ove poboljšane komunikacijske sposobnosti prenesene su i na Sol i Luna, obećavajući veću jasnoću, manje žargona i kraće odgovore bez gubitka sadržaja, što je posebno vidljivo u tehničkim i kodnim razgovorima.

Uz niže cijene tokena, razvijatelji koji koriste GPT‑6 mogu dodatno uštedjeti na predmemoriranom kontekstu koji njihove aplikacije ponovno koriste. Poboljšano predmemoriranje upita (prompt caching) omogućuje veći postotak pogođenih cacheova, što rezultira bržim odgovorima i popustima od 90% na čitanje predmemoriranih ulaznih tokena.

Razvijatelji sada imaju više alata za mjerenje i optimizaciju performansi predmemoriranja:

  • Praćenje i dijagnostika: Prompt Caching Dashboard prikazuje količinu predmemoriranog ulaza, dok alat za dijagnostiku objašnjava propuštene prilike za predmemoriranje.
  • Prilagodba napora i dostupnosti alata: Moguće je povećati ili smanjiti napor za obradu zadataka, te uključiti ili isključiti alate, uz očuvanje predmemoriranog konteksta.
  • Optimizacija predmemoriranih prefiksa: Eksplicitne točke prekida (explicit breakpoints) omogućuju razvojnim inženjerima kontrolu nad time koji dijelovi upita bivaju predmemorirani.

Ova poboljšanja, prema izvješćima s GitHub-a, smanjila su potrebu za svježom obradom tokena za više od 50% kroz milijarde zahtjeva, pomažući Copilot-u da brže odgovara.

Nastavak poboljšanja usklađenosti (Alignment)

GPT‑6 Sol i Luna nadograđuju rad na usklađenosti započet s Astra-om. U internim evaluacijama usklađenosti, oba modela pokazuju poboljšanja u odnosu na svoje GPT-5.6 prethodnike, uključujući smanjenu stopu pogrešnih tvrdnji vezanih uz kodiranje.

Evaluacije uključuju:

  • Coding deception (kodna prijevara)
  • Broken search (puknuta pretraga)
  • Reviewer bypass (zaobilaženje recenzenta)
  • Warning circumvention (zaobilaženje upozorenja)
  • Unauthorized interaction (neovlaštena interakcija)

U internoj evaluaciji kodne prijevare, gdje su agenti dobivali zadatke namjerno osmišljene da potaknu nepoštenje, GPT‑6 Sol pokazuje stopu prijevare od 0.5%, dok GPT‑6 Luna ima stopu od 1.3%. Ovo predstavlja značajno poboljšanje u odnosu na prethodne modele.

Grafikon koji prikazuje stopu obmane pri kodiranju, gdje je niža stopa bolja. Vrijednosti su: GPT-6 Astra 0,5%, GPT-6 Sol 1,3%, GPT-5.6 Sol 10,4%, GPT-6 Luna 2,8%, GPT-5.6 Luna 9,5%

Dostupnost

GPT‑6 Sol i GPT‑6 Luna dostupni su u ChatGPT Work i Codex za sve Plus, Pro, Business, Enterprise i Edu korisnike od danas. Besplatni i Go korisnici mogu pristupiti GPT‑6 Luna u desktop aplikaciji. Ovi modeli još nisu dostupni u Chat sučelju. U OpenAI API-ju dostupni su pod nazivima gpt-6-sol i gpt-6-luna.

Radi stabilnosti usluge, planira se postupno uvođenje ovih modela u ChatGPT tijekom dana. Ako novi modeli nisu odmah vidljivi, molimo pokušajte ponovno kasnije.

Često postavljana pitanja

Koje su glavne razlike između GPT-6 Astra, GPT-6 Sol i GPT-6 Luna?

GPT-6 Astra je najinteligentniji i najusklađeniji model, namijenjen najzahtjevnijim zadacima. GPT-6 Sol i GPT-6 Luna nude napredne mogućnosti Astre po znatno nižoj cijeni, čineći ih idealnim za širi spektar svakodnevnih i profesionalnih zadataka gdje je isplativost ključna.

Za koliko su snižene cijene API-ja za GPT-6 Sol i GPT-6 Luna?

Cijene API-ja za GPT-6 Sol i GPT-6 Luna snižene su za 50% u usporedbi s promotivnim cijenama njihovih prethodnika iz GPT-5.6 serije.

Koje su prednosti poboljšanog predmemoriranja (caching) u GPT-6 modelima?

Poboljšano predmemoriranje omogućuje agentima ponovno korištenje više konteksta, ubrzava odgovore i donosi popuste do 90% na čitanje predmemoriranih ulaznih tokena. Razvijeni su i alati za praćenje, dijagnostiku i optimizaciju predmemoriranja.