Četiri istaknute laboratorije za vještačku inteligenciju (AI) objavile su frontier jezičke modele u razmaku od tri sedmice tokom jula 2026, a jaz između onoga što ti sistemi završavaju bez ljudske intervencije i onoga što je postojalo ranije oštro se suzio. Grok 4.5 kompanije xAI, Claude Opus 5 kompanije Anthropic, porodica GPT-5.6 kompanije OpenAI i Kimi K3 kompanije Moonshot AI ciljaju isti problem: kako navesti AI sistem da višesatni zadatak, od istraživanja preko programiranja do strukturisanog izvještavanja, iznese do kraja bez gubljenja plana.
xAI je Grok 4.5 objavio 8. jula. Model počiva na bazi od 1,5 biliona parametara i dijelom je treniran na stvarnim podacima o korišćenju platforme Cursor, koju je SpaceXAI kupio ranije ove godine. Cijena je 2 dolara po milionu ulaznih i 6 dolara po milionu izlaznih tokena, uz kontekstni prozor od 500.000 tokena. Elon Musk je Grok 4.5 opisao kao model Opus klase koji radi brže i uz nižu cijenu. Nezavisni trackeri smještaju ga na četvrto mjesto na listi Artificial Analysis Intelligence Index, ispred svakog open weight modela, uz cijenu više od 60 odsto nižu od Claude Opus 4.8 i GPT-5.5. Na testu Terminal-Bench 2.1, koji mjeri koliko dobro model završava inženjerske zadatke u komandnoj liniji, Grok 4.5 je ostvario 83,3 odsto. xAI navodi da modelu treba otprilike petina izlaznih tokena koje je Opus 4.8 trošio na uporedive zadatke.
Anthropic je Claude Opus 5 objavio 24. jula, pozicionirajući ga kao model koji se približava performansama Claude Fable 5, najsposobnijeg izdanja te kompanije, uz upola nižu cijenu od Fable, koji košta 10 dolara za ulaz i 50 dolara za izlaz. Sam Opus 5 zadržava istu cijenu kao prethodnik Opus 4.8, 5 dolara za ulaz i 25 dolara za izlaz. Dolazi sa kontekstnim prozorom od milion tokena, najviše 128.000 izlaznih tokena i podesivim nivoom rezonovanja, od niskog do novog xhigh režima. Anthropic tvrdi da Opus 5 postavlja nove rekorde na testovima Frontier-Bench i GDPval-AA, ali da zaostaje za ograničenim modelom Claude Mythos 5 na zadacima iz sajber bezbjednosti. Opus 5 je sada podrazumijevani model na pretplati Claude Max i najjača opcija na Claude Pro.
OpenAI je GPT-5.6 pustio u opštu dostupnost 9. jula, poslije dvosedmičnog preview perioda ograničenog na oko 20 organizacija koje je provjerila vlada SAD, u skladu sa izvršnom naredbom vezanom za bezbjednosnu reviziju frontier modela. Porodica ima tri nivoa: Sol kao vodeći model po 5 dolara za ulaz i 30 dolara za izlaz po milionu tokena, Terra u srednjem sloju po 2,50 i 15 dolara, za koji OpenAI kaže da izjednačava GPT-5.5 uz upola nižu cijenu, i Luna kao brz i jeftin sloj po 1 i 6 dolara. OpenAI navodi da Sol vodi na listi Artificial Analysis Coding Agent Index i dostiže 88,8 odsto na Terminal-Bench 2.1, odnosno 91,9 odsto kada model pokrene četiri sub-agenta paralelno u novom ultra režimu. Sva tri nivoa nose najviši interni rejting rizika koji OpenAI dodjeljuje za mogućnost zloupotrebe u sajber i biološkom domenu, što je izazvalo dodatnu reviziju tokom preview faze pod kontrolom vlade.
Moonshot AI je Kimi K3 objavio 16. jula, model tipa mixture of experts sa 2,8 biliona parametara, 896 eksperata ukupno i 16 aktivnih po zadatku. Nosi kontekstni prozor od milion tokena i nativni multimodalni ulaz, uz API cijenu od 3 dolara za ulaz i 15 dolara za izlaz po milionu tokena. Moonshot se obavezao da će pune open weights objaviti do 27. jula. K3 je do sada najveći objavljeni open-weight model, oko 75 odsto veći od prethodno najvećeg široko korišćenog otvorenog modela, a nezavisni trackeri ga svrstavaju na četvrto mjesto među aktuelnim frontier sistemima, iza Claude Fable 5 i GPT-5.6 Sol, a ispred Claude Opus 4.8.
Kontekstni prozori ispod 200.000 tokena ranije su tjerali programere da velike baze koda ili istraživačke materijale cijepaju na fragmente; svaki model iz ove grupe sada radi na 500.000 tokena ili više, a tri od četiri na milion, što jednoj sesiji omogućava da drži cio repozitorijum ili čitav niz primarnih dokumenata. Pomjerila se i pouzdanost agenata, jer su sistemi iz 2023. i 2024. često gubili plan poslije nekoliko poziva alata, dok su modeli objavljeni ovog mjeseca građeni tako da izdrže desetine koordinisanih koraka i da se oporave kada poziv alata vrati loše podatke. Za programere je praktičan efekat niža cijena po završenom zadatku, a ne viši plafon na pojedinačnom benchmarku, dok za kompanije i kreatore politika rollout GPT-5.6 pod kontrolom vlade signalizira da je nadzor sada ugrađen u rasporede objavljivanja najvećih modela, a ne dodat naknadno; kratkotrajna, vladinom odlukom izazvana obustava pristupa modelima Fable i Mythos koju je Anthropic sproveo u junu bila je raniji primjer istog obrasca.
Izvor: Bitcoin.com News