
xAI ·
Grok 4.6 w ścisłej czołówce medycznych benchmarków
Grok 4.6 znalazł się w pierwszej trójce rankingu Artificial Analysis Healthcare & Medical Index. Wersja high: 50 punktów, zaledwie punkt za liderem (51). Wyprzedził m.in. GPT-5.6 Sol, Kimi K3 i Gemini 3.7 Flash.
Indeks ocenia wiedzę medyczną, rozumowanie kliniczne, dokumentację pacjenta, ograniczanie halucynacji i agentyczne workflow’y. Błędy w tej domenie nie są teoretyczne.
Jeszcze niedawno modele z tej rodziny były w tyle w testach medycznych. Teraz walczą o szczyt — xAI domyka dystans w zastosowaniach specjalistycznych.

Źródło: post @XFreeze na X. Warto oglądać kolejne aktualizacje — tempo poprawy w tej dziedzinie jest zauważalne.
← Wszystkie wpisy


