Skip to content
KURS: Agenci AI od podstaw
zbuduj zespół cyfrowych pomocników
Sprawdzam
KURS: Agenci AI
Sprawdzam
logo Devstock
  • O nas
  • Moduły Akademii
    • Moduł 1
    • Moduł 2
    • Moduł 3
    • Pozostałe moduły
  • Kursy AI i IT
    • Pierwsza Misja AI (Podstawy)
    • Automatyzacje z n8n 2.0
    • Frontend Master 2026
  • Blog
  • Kontakt
  • O nas
  • Moduły Akademii
    • Moduł 1
    • Moduł 2
    • Moduł 3
    • Pozostałe moduły
  • Kursy AI i IT
    • Pierwsza Misja AI (Podstawy)
    • Automatyzacje z n8n 2.0
    • Frontend Master 2026
  • Blog
  • Kontakt
Live o agentach AI, poniedziałek 21 września o 20:00, udział bezpłatny - zapisz się
Branża IT i Nowe Technologie

Grok 4.6 zrównał się z GPT-5.6 w jednym indeksie

  • 13 sie, 2026
  • Komentarze 0
Grok 4.6 - robot w garniturze z logo Grok na ekranie zamiast głowy wskazuje palcem wykres słupkowy, na którym najwyższy słupek świeci na niebiesko z boku, a drugi robot słucha z pierwszego planu

Na stronie z ogłoszeniem stoi wykres z pięcioma grupami słupków i cztery modele w każdej z nich. Zdanie, które z tego wykresu wyciągnięto do komunikatu, mówi o wyrównaniu z GPT-5.6 Sol na indeksie Artificial Analysis. Jest prawdziwe: oba modele mają tam po 61 punktów. Kłopot polega na tym, że na tym samym wykresie, w tej samej grupie słupków, stoi jeszcze jeden model z wynikiem 62. xAI ogłosiło Groka 4.6 12 sierpnia i jest to solidny model, tylko historia opowiedziana jednym zdaniem wygląda inaczej niż ta sama historia opowiedziana całym obrazkiem.

Co właściwie znaczy wyrównanie na indeksie

Zacznijmy od tego, o czym mówi ta jedna liczba, bo bez tego reszta wisi w powietrzu.

Indeks Artificial Analysis nie jest pojedynczym testem. To wynik złożony z dziewięciu różnych testów, sprowadzony do jednej liczby, i sam producent opisuje go w komunikacie właśnie tak. Taki wskaźnik ma jedną wbudowaną wadę. Nie pokazuje różnic między modelami w poszczególnych zadaniach.

Dlatego zdanie o wyrównaniu z konkurentem trzeba czytać wąsko. Znaczy ono tyle, że w tym jednym zestawieniu wychodzi ta sama cyfra. Nie znaczy, że oba modele radzą sobie tak samo z twoim zadaniem.

Na wykresie samego xAI inny model stoi wyżej

Tabela poniżej to odczyt wykresu ze strony wydania, bez żadnych liczb z zewnątrz. Wszystkie wartości podał producent, łącznie z wynikami konkurencji i własnej poprzedniej wersji.

TestGrok 4.6Grok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
Indeks Artificial Analysis61566162
GDPVal-AA v21753152617281741
CursorBench v3.269,9%66,7%67,2%70,5%
DeepSWE v1.165,9%54%73%70%
FrontierCode v1.161,3%56,6%60,6%63,6%

Wynik czyta się szybko. Na pięć pozycji nowy model wygrywa z konkurencją w jednej, a w czterech ustępuje któremuś z porównywanych. W teście programistycznym DeepSWE różnica do GPT-5.6 Sol wynosi ponad siedem punktów procentowych na jego niekorzyść.

Nie jest to zarzut wobec xAI, bo firma sama te słupki narysowała i niczego nie ukryła. Jest to natomiast powód, żeby traktować wykres producenta jako materiał do przeczytania, a nie do zacytowania. Blog przerabiał to niedawno przy rankingu chińskich modeli wideo, gdzie kolejność w zestawieniu też okazała się ciekawsza niż nagłówek, oraz przy wydaniu flagowca Alibaby.

Najciekawsza kolumna to ta z poprzednią wersją

Porównanie z konkurencją zawsze przyciąga wzrok najbardziej, a najwięcej mówi tu kolumna obok.

Względem Groka 4.5 postęp jest wyraźny i widać go w każdej pozycji. Na indeksie złożonym przybyło pięć punktów, z 56 na 61. W teście programistycznym DeepSWE skok jest największy: z 54 na 65,9 procent, czyli o blisko dwanaście punktów. W teście GDPVal wynik urósł z 1526 na 1753.

Ta kolumna pokazuje zmianę wewnątrz jednej rodziny modeli, według pomiarów xAI. Sam wykres nie pozwala orzec, czy jest to porównanie uczciwsze od pozostałych, bo producent nie opisuje warunków, w jakich mierzył cudze modele.

Praktyczny wniosek jest ostrożniejszy, niż podpowiadają słupki. Wyniki xAI wskazują poprawę we wszystkich pięciu pozycjach, z największym wzrostem w teście DeepSWE, a jej skalę w codziennej pracy trzeba sprawdzić osobno. Kto porównuje ofertę kilku dostawców, ten i tak musi sięgnąć po pomiar spoza tej strony.

W tablicy, którą xAI cytuje, to szóste miejsce

Skoro producent powołuje się na zewnętrzny indeks, wypada tam zajrzeć. Zrobiliśmy to w dniu pisania tego tekstu.

Artificial Analysis daje Grokowi 4.6 w trybie wysokim 61 punktów i umieszcza go na szóstej pozycji spośród 184 mierzonych modeli. Czoło tej tablicy zajmuje dziś wynik 63. Szóste miejsce na 184 pozycje to dobry rezultat i nie ma powodu go umniejszać. Warto jednak wiedzieć, że wyrównanie z jednym konkurentem nie oznacza tu pierwszego miejsca.

Ta sama tablica mierzy jeszcze coś, czego na wykresie producenta nie ma. Model generuje odpowiedzi z prędkością 67,6 tokena na sekundę, a Artificial Analysis opisuje to jako wynik poniżej przeciętnej wśród modeli rozumujących w podobnej półce cenowej. Przy zadaniach, do których ten model jest reklamowany, czyli przy długo działających agentach, prędkość może wpływać na czas oczekiwania.

Pierwsza Misja AI · Kodożercy

Pierwszy raz z AI? Zaczynasz od zera.

Pierwsza Misja AI to kurs dla osób bez technicznego backgroundu. Zero kodu, zero żargonu. Dowiesz się jak działa AI, jak promptować i jak korzystać z niej w pracy.

Wejdź na pokład →
Pierwsza Misja AI - Kodożercy

Ile kosztuje i gdzie faktycznie działa

Ta część komunikatu jest konkretna i akurat tu nie ma czego prostować.

Milion tokenów wejścia kosztuje 2 dolary, milion wyjścia 6 dolarów. Jest też wariant szybszy, za dwukrotność tych stawek. Model działa w Cursorze, w Grok Build, przez konsolę interfejsu programistycznego oraz u pośredników: w OpenRouterze, Vercelu i Cloudflare.

Do tego xAI dorzuca zachętę na start. Przez pierwszy tydzień w Grok Build i w Cursorze obowiązuje podwójna pula wliczonego użycia. Taka promocja jest jednocześnie miłym gestem i sygnałem, gdzie producent chce zobaczyć ten model w pracy. Obie objęte nią usługi to narzędzia, w których agent pracuje długo i samodzielnie.

Czego w komunikacie nie ma

Dwie rzeczy warto powiedzieć wprost, bo pierwsza dotyczy tego, czego brakuje, a druga tego, co łatwo pomylić.

Komunikat nie podaje rozmiaru okna kontekstowego. Przy modelu reklamowanym jako narzędzie do długich zadań agentowych jest to akurat parametr, o który wypadałoby zapytać w pierwszej kolejności, i nie zamierzamy go zgadywać. O wariancie szybszym też mówi niewiele ponad to, że kosztuje dwa razy więcej.

Druga sprawa to nazwy. W polskich serwisach przewinęła się 12 sierpnia informacja o zupełnie innym produkcie o podobnie brzmiącej nazwie. Opisywana tu premiera dotyczy modelu językowego dostępnego przez interfejs programistyczny.

Najczęstsze pytania

Dwa pytania nasuwają się przy tej premierze natychmiast i oba mają odpowiedź bardziej złożoną niż tak albo nie.

Czy Grok 4.6 jest liderem rankingu?

Nie, choć stoi blisko czoła. Na indeksie złożonym z dziewięciu testów nowy model xAI ma tyle samo punktów co GPT-5.6 Sol, czyli 61. Na wykresie samego producenta w czterech wierszach z pięciu przynajmniej jeden porównywany model ma wynik wyższy. Dotyczy to także testu programistycznego DeepSWE, gdzie GPT-5.6 Sol ma 73 procent wobec 65,9. W niezależnej tablicy Artificial Analysis to szósta pozycja na 184 mierzone modele, przy czole zestawienia na poziomie 63 punktów. Rozsądny wniosek brzmi więc tak: to model z czołówki, ale nie jej lider. Przy konkretnym zastosowaniu wypada porównać go samodzielnie, zamiast ufać jednej zbiorczej cyfrze.

Skąd pochodzą liczby, którymi chwali się producent?

Wszystkie wartości na wykresie podał sam xAI, łącznie z wynikami konkurencji. Jeden z nich, indeks Artificial Analysis, można sprawdzić u niezależnego mierzącego i to zrobiliśmy. Dla pozostałych czterech testów nie znaleźliśmy pomiaru wykonanego poza firmą. W dniu ogłoszenia to normalne i nie oznacza, że liczby są nieprawdziwe. Oznacza tylko, że pochodzą od strony zainteresowanej wynikiem, i tak warto je traktować do czasu pojawienia się niezależnych pomiarów.

Podsumowanie

xAI ogłosiło 12 sierpnia model Grok 4.6, kierowany do długo działających agentów oraz pracy interaktywnej i wizualnej. Komunikat podkreśla wyrównanie z GPT-5.6 Sol na indeksie Artificial Analysis, gdzie oba mają po 61 punktów. Na tym samym wykresie trzeci porównywany model ma 62 punkty, a w czterech wierszach z pięciu wyżej wypada przynajmniej jeden konkurent. Wyraźny postęp widać za to wobec poprzedniej wersji, z 56 na 61 punktów indeksu i z 54 na 65,9 procent w teście DeepSWE. W niezależnej tablicy Artificial Analysis to szóste miejsce spośród 184 pozycji, przy czole zestawienia na poziomie 63 punktów, a prędkość 67,6 tokena na sekundę opisano tam jako poniżej przeciętnej w tej półce cenowej. Model kosztuje 2 dolary za milion tokenów wejścia i 6 za milion wyjścia, działa w Cursorze, Grok Build, konsoli interfejsu programistycznego oraz u trzech pośredników. Przez pierwszy tydzień obowiązuje podwójna pula wliczonego użycia, a rozmiaru okna kontekstowego komunikat nie podaje.

Newsletter · DevstockAcademy & Kodożercy

Bądź na bieżąco ze światem IT, AI i automatyzacji

Co wtorek: newsy z branży, praktyczne tipy i narzędzia które warto znać. Zero spamu.


Udostępnij na:
Mateusz Wojdalski

Specjalista SEO i content marketingu w Devstock. Zajmuję się strategią treści, automatyzacją procesów marketingowych i wdrożeniami AI w codziennej pracy. Badam nowe narzędzia, adaptuję je do realnych zadań i piszę o tym, co faktycznie działa.

Katalog CISA i trzy luki. Jedna sięga najdalej
Bezpieczne Dane gov.pl: jak sprawdzić wyciek danych
Pudelko kursu Agenci AI od Kodozercow z robotem i schematem przeplywu agentow
Banner reklamowy Frontend Master 2026

Najnowsze wpisy

Thumb
Składany iPhone Duo. Cena i data przedsprzedaży
13 wrz, 2026
Thumb
iPhone 18 Pro Max cena w Polsce
13 wrz, 2026
Thumb
Nowy prezes Apple. John Ternus zastąpił Tima
13 wrz, 2026
Thumb
Ollama w ChatGPT Desktop: modele otwarte na
13 wrz, 2026
Thumb
Homebrew 7.0 na Macu: skaner luk, Intel
13 wrz, 2026

Kategorie

  • Aktualności i Wydarzenia (98)
  • Bezpieczeństwo i Jakość (182)
  • Branża IT i Nowe Technologie (257)
  • Design i User Experience (4)
  • Narzędzia i Automatyzacja (147)
  • Programowanie i Technologie Webowe (81)
  • Rozwój kariery i Edukacja (39)

Tagi

5G AI Architektura Cyberbezpieczeństwo Feedback Frontend Git IoT JavaScript Motywacja Nauka efektywna Optymalizacja i wydajność Programowanie React.JS Rozwój osobisty WebDevelopment
Logo FitBody Center Warszawa

Odkryj zabiegi Endermologii LPG Infinity w FitBody Center Warszawa

Maszyna zabiegowa - endermologia lpg infinity
banner-reklamowy-frontend-master
Pudelko kursu Agenci AI od Kodozercow z robotem i schematem przeplywu agentow
Group-5638-1

Devstock – Akademia programowania z gwarancją pracy

🏠 ul. Bronowska 5a,
03-995 Warszawa
📞 +48 517 313 589
✉️ contact@devstockacademy.pl

Linki

  • Poznaj firmę Devstock
  • Wejdź do społeczności Devstock
  • Polityka prywatności
  • Regulamin

FitBody Center

Strona

  • Strona główna
  • Kontakt

Newsletter

Bądź na bieżąco, otrzymuj darmową wiedzę i poznaj nas lepiej!


Icon-facebook Icon-linkedin2 Icon-instagram Icon-youtube Tiktok
Copyright 2026 Devstock. Wszelkie prawa zastrzeżone
Devstock AcademyDevstock Academy
Sign inSign up

Sign in

Don’t have an account? Sign up
Lost your password?

Sign up

Already have an account? Sign in