Kompania xAI e Elon Musk-ut ka publikuar të hënën në mbrëmje modelin e saj më të ri, Grok 4.7, duke e cilësuar si përmirësimin më të dukshëm deri më tani në krahasim me Grok 4.6, me të njëjtin çmim dhe shpejtësi.
Lançimi vjen pas disa shtyrjeve të njëpasnjëshme. Që nga fundi i korrikut, Musk e ka ndryshuar afatin e publikimit disa herë, duke kaluar nga "katër javë" në "disa javë", më pas në "3 deri në 4 javë", pastaj në "10 ditë" në fillim të shtatorit, e në fund duke thënë se modelit i duheshin "edhe pak ditë për t'u gatuar".
Sipas xAI, Grok 4.7 shpenzon më shumë kohë duke analizuar problemet e vështira dhe rikontrollon përgjigjet e veta më shpesh se paraardhësi i tij. Kompania thekson gjithashtu se ky është modeli me masat më të forta të sigurisë të prodhuara ndonjëherë prej saj. Musk e ka përshkruar Grok 4.7 si "një kombinim të fortë inteligjence, shpejtësie dhe kostoje të ulët", ndërsa këtë herë modeli është bërë menjëherë i disponueshëm, pa listë pritjeje, në aplikacionin Grok, në Cursor, në Grok Build dhe përmes API-së së xAI.
Më shumë parametra, kosto e njëjtë
Grok 4.7 përmban 2.1 trilionë parametra, rreth 40% më shumë se 1.5 trilionët e Grok 4.6, i cili nga ana e tij ishte një përpunim i mëtejshëm i Grok 4.5. Çmimi mbetet 2 dollarë për një milion token hyrës dhe 6 dollarë për një milion token dalës. Parametrat përfaqësojnë rregullimet e brendshme që modeli i stërvit gjatë trajnimit, dhe zakonisht sa më shumë prej tyre, aq më e madhe është kapaciteti për të mësuar modele të reja sjelljeje.
xAI ka përfshirë në trajnim edhe të dhëna shtesë nga SpaceX, kompania tjetër e Musk-ut, përfshirë telemetrinë e satelitëve Starlink, regjistrimet e prodhimit dhe raportet e defekteve inxhinierike. Qëllimi është krijimi i një modeli që arsyeton më mirë rreth hardware-it dhe sistemeve fizike, në krahasim me modelet e trajnuara vetëm me tekst nga interneti.
Rezultatet krahasuese mbeten prapa
Matjet e performancës tregojnë një storje të njohur tashmë. Testi GDPval, që vlerëson punën reale me vlerë ekonomike si memo ligjore, tabela dhe prezantime, e vendos Grok 4.7 me rezultat 1695 në një sistem vlerësimi tip shah, ndërsa Claude Fable 5.1 arrin në krye me 1735 pikë.
Në testin AA-Briefcase, që mat performancën në detyra zyre shumëorëshe, Grok 4.7 shënoi 1657 pikë kundrejt 1678 pikëve të Fable 5.1. Edhe në CursorBench 4.0, testi që vlerëson detyra reale programimi brenda editorit Cursor, Grok 4.7 renditet në mes: më i shtrenjtë për detyrë se GPT-6 Astra dhe Claude Sonnet 5, por ende pas Fable 5.1, i cili mbetet fitues në çdo pikë çmimi.
Kjo nuk është hera e parë që xAI has një situatë të tillë. Grok 4.5, i lançuar në korrik me grupimin më të madh trajnimi në industri, arriti vetëm vendin e tretë pas modeleve të Claude dhe OpenAI. Para tij, Grok 4.20 kishte sakrifikuar besueshmërinë në favor të shpejtësisë dhe personalitetit, ndërsa Grok 4.6 kishte mbetur gjithashtu pas liderëve të tregut për sa i përket autonomisë në programim.
