Ocena odbiorców: 27 modeli AI, ChatGPT na 8. miejscu – oto modele, które go przewyższyły

Chociaż świat sztucznej inteligencji (AI) może często wydawać się burzliwy, za kulisami przeprowadza się zaskakująco dużo analiz, pomiarów wydajności i testów. Robią to nie tylko same firmy, ale także grupy powołane do ustalania własnych rankingów.

Sztuczna inteligencja (AI) i świecący mózg obok ekranu smartfona

Grupy te testują wszystko, od zdolności chatbota do wykonywania testów matematycznych,
Utwórz obrazylub podać logiczne wyjaśnienia, a nawet udzielić porady medycznej lub po prostu pokazać, jak bardzo jest inteligentna emocjonalnie.

Podczas tych zróżnicowanych testów modele ujawniają swoje mocne i słabe strony w różnych obszarach. Na przykład, choć GPT-5 wyróżnia się w dedukcji naukowej, to ustępuje modelom takim jak Gemini i Claude pod względem zdolności adaptacji do nowych koncepcji.

Każdy z tych testów mówi nam coś nowego o modelach AI i jest ważny, ponieważ przypomina nam, które narzędzia sprawdzają się najlepiej w różnych scenariuszach. Często jednak brakuje jednej metryki: które modele AI zapewniają najlepsze doświadczenia użytkownika?

System klasyfikacji humanoidalnej

Ranking pięciu najlepszych chatbotów AI

Brytyjska firma technologiczna Prolific stworzyła ranking sztucznej inteligencji o nazwie Humaine . Zamiast testować zdolność sztucznej inteligencji do wykonywania zadań, Prolific testował różne doświadczenia użytkowników z wykorzystaniem tych modeli.

Oceniając doświadczenia 21 352 osób z narzędziami, udało się nie tylko wyłonić zwycięzcę, ale także podzielić wyniki ze względu na wiek, lokalizację (testy przeprowadzono zarówno w Wielkiej Brytanii, jak i w USA) i poglądy polityczne.

Obejmuje to pojedyncze oferty dla:

  • Wielka Brytania: Grupy wiekowe
  • Wielka Brytania: Rasa
  • Wielka Brytania: Poglądy polityczne
  • Stany Zjednoczone: Grupy wiekowe
  • Stany Zjednoczone: Rasa
  • Stany Zjednoczone: Pogląd polityczny

Każdy uczestnik miał okazję do interakcji z dwoma różnymi modelami sztucznej inteligencji, aby je porównać, a następnie poproszono ich o podanie informacji zwrotnej na temat tego, który model wypadł lepiej w każdej interakcji.

W rezultacie wyłoniono zwycięzcę w klasyfikacji generalnej i tabeli liderów za wydajność, a także oddzielne rankingi za podstawowe wykonywanie zadań i rozumowanie, a także zwycięzcę za komunikację, odporność, zaufanie i etykę.

Co pokazują wyniki?

Loga ChatGPT i Gemini

Po gruntownej analizie wyłoniono wyraźnego zwycięzcę, nie tylko w kategorii ogólnej wydajności, ale także w większości podkategorii. Gemini 2.5-Pro ​​wyróżniał się w niemal każdym benchmarku objętym testem.

Młodzi dorośli w wieku 18-34 lat w Wielkiej Brytanii, wyborcy Partii Demokratycznej oraz osoby powyżej 55. roku życia w USA zgodnie uznali Gemini 2.5 Pro za najlepszy model w ogólnym rozrachunku. Jedynym obszarem, w którym wszystkie grupy demograficzne oceniły go wyżej niż Gemini, było zaufanie, etyka i bezpieczeństwo – był to Grok-3 – co jest nieco ironiczne, biorąc pod uwagę problemy z bezpieczeństwem i etyką, z jakimi borykał się ostatnio model sztucznej inteligencji.

Co ciekawe, trzy modele, które pojawiły się po Gemini, to Deepseek, Magistral Le Chat i Grok . Chociaż Deepseek cieszył się znaczną popularnością na początku tego roku, ostatnio zniknął z pola widzenia. Le Chat z kolei jest mniej popularnym chatbotem, ale może pochwalić się lojalną rzeszą użytkowników.

Gdzie w tym wszystkim plasuje się światowej sławy ChatGPT? Znajduje się na samym dole listy, zajmując ósme miejsce ze swoim najlepszym modelem GPT-4.1. Jeszcze gorzej jest z Claude , którego dwie wersje (4.0 i 4.0) zajęły odpowiednio jedenaste i dwunaste miejsce w klasyfikacji generalnej.

Co to wszystko oznacza?

Czy to oznacza, że ​​Gemini jest najlepszym chatbotem AI na świecie? Czy to oznacza, że ​​powinieneś porzucić ChatGPT…? Cóż, nie do końca.

Te wyniki niekoniecznie odzwierciedlają wydajność tych modeli. Podczas testów na większości innych metryk, opcje, które zazwyczaj widzimy na górze, to ChatGPT, Gemini, Claude i Grok.

Jest to jednak ważny dodatek do tych testów. Pomagają nam lepiej zrozumieć sztuczną inteligencję z perspektywy ludzkiego doświadczenia. Na przykład Le Chat nie osiąga wysokich wyników w standardowych testach porównawczych, ale często jest uznawany za doskonały wybór pod względem doświadczenia i wiarygodności.

Chociaż wyniki Anthropic i OpenAI nie osiągnęły tak wysokiego poziomu w tej rundzie testów, Gemini i Grok zaliczyły kolejny dobry występ. Obie firmy często osiągają wysokie wyniki w standardowych testach porównawczych i tak było również w tym przypadku.

Możliwość dodawania komentarzy nie jest dostępna.