Lepiej niż Fable 5 i GPT-5.6? Chińczycy zaprezentowali nowy model Kimi V3, ale brakuje niezależnych pomiarów

  • Chińska Moonshot AI zaprezentowała Kimi K3 – model z 2,8 biliona parametrów i kontekstem do 1 miliona tokenów
  • Według producenta miażdży chińską konkurencję GLM 5.2, ale z zachodnią czołówką (Fable 5, GPT-5.6, Opus 4.8) raczej remisuje
  • Wszystkie liczby pochodzą od Moonshot, część nawet z wewnętrznego benchmarku – niezależnych testów jeszcze brakuje

Sdílejte:
Jakub Kárník
Jakub Kárník
23. 7. 2026 20:00

Etykietka „pokonuje najlepsze zachodnie modele” w roku 2026 przylepia się niemal do każdego drugiego ogłoszenia z Chin. Teraz przyszła kolej na Moonshot AI z ich nowym flagowym modelem Kimi K3. Na papierze to prawdziwe działo: 2,8 biliona parametrów, architektura Mixture-of-Experts i okno kontekstowe do 1 miliona tokenów. Ambicje są jasne – konkurować z tym, co najlepsze oferują dziś OpenAI, Anthropic oraz krajowi rywale.

Bilion parametrów i pamięć na całe repozytorium

Największą atrakcją jest właśnie milionowe okno kontekstowe. Programista może załadować do jednej konwersacji całe repozytorium, kilka prac naukowych lub stos dokumentów prawnych, bez konieczności agresywnego skracania tekstu. Moonshot celuje z Kimi K3 przede wszystkim w deweloperów – ma on nie działać jako podpowiadacz kodu, ale jako partner, który rozumie duże projekty, refaktoryzuje pliki i potrafi debugować błędy. Do tego dochodzi praca z obrazem, tak zwane roje agentów i integracja z własnym narzędziem Kimi Code. Pełny milion tokenów będzie jednak dostępny tylko dla subskrybentów wyższych taryf, tańszy poziom zatrzyma się na 256 tysiącach.

Benchmarki, które należy traktować z rezerwą

A teraz to, co najważniejsze, na czym opiera się całe zamieszanie. W porównaniu do chińskiego rywala GLM 5.2, Kimi K3 jest rzeczywiście o klasę wyżej – w teście DeepSWE zdobył 67,5 punktu wobec 46,2, w SWE Marathonie nawet 42 wobec zaledwie 13. Tam nie ma żadnej dyskusji. Jednak nagłówek „pokonuje Claude Fable” to już marketingowa przesada. W porównaniu do zachodniej czołówki Kimi K3 wygrywa tylko czasami: w Program Bench (77,8) i SWE Marathonie (42,0) jest co prawda pierwszy, ale w DeepSWE Fable 5 i GPT-5.6 Sol go przewyższają, a w stworzonym przez Moonshot Kimi Code Bench 2.0 zajął 72,9 punktu za Fable 5 (76,9). To, że producent w swoim własnym teście zadba o ładną liczbę, nikogo nie dziwi – dlatego właśnie na wewnętrzne benchmarki należy patrzeć z przymrużeniem oka, dopóki nie pojawią się niezależne pomiary.

Prawdziwe pole bitwy nazywa się kod

Niezależnie od tego, jak wypadną liczby po ponownym pomiarze, kierunek jest jasny. Kimi Code dołącza do tej samej ligi co Claude Code od Anthropic lub Codex od OpenAI, a walka o programistów staje się główną areną całej branży. Dla deweloperów to dobra wiadomość – konkurencja obniża ceny i zwiększa możliwości. Resztę entuzjastycznych superlatywów zostawmy jednak na moment, gdy Kimi K3 przejdzie przez ręce kogoś innego niż jego twórców.

Ufacie benchmarkom od samych producentów, czy czekacie na niezależne testy?

Źródło: Data Science in Your Pocket, Moonshot AI

O autorze

Jakub Kárník

Jakub je znám svou nekonečnou zvědavostí a vášní pro nejnovější technologie. Jeho láska k mobilním telefonům začala s iPhonem 3G, ale dnes se spoléhá na… Więcej o autorze

Jakub Kárník
Sdílejte: