
Семь нейросетей прошли слепой бой: победил Fable 5.1, Kimi K3 выиграла больше заданий
Что проверяли
Семь команд представили свои модели – Fable 5.1, GPT‑5.6 Sol, Kimi K3, Qwen 3.8 Max, Gemini 3.8 Flash, Grok 4.6 и DeepSeek V4 Pro – и попросили решить восемь разных задач: личный сайт‑презентацию, инфографику, 3‑D‑робота, мини‑игру, рекламный кадр, гимн, логическую загадку и турнир муравьиных алгоритмов. Судьи оценивали анонимные работы по скриншотам, консольному логу и сетевым запросам, ставя от 0 до 5 баллов, максимум 30 за задание.
Итоги по баллам
Fable 5.1 набрал 145 очков и возглавил рейтинг. На втором месте оказался Kimi K3 с 133 баллами, а GPT‑5.6 Sol занял третье место – 118. По отдельным заданиям лидировали разные модели: инфографику и 3‑D‑робота создала Kimi K3, страницу‑презентацию – Fable 5.1.
Пазл и муравьиный турнир
Загадка о четырёх выживших после крушения разгадала только Gemini 3.8 Flash, сделав 19 запросов. Qwen сдалась на восьмом вопросе, потратив 165 тыс. токенов, DeepSeek не дошёл до конца, а GPT прошёл все 20 вопросов, используя лишь 3 160 токенов. В турнире без судей Fable 5.1 показала лучший результат – 77,5 из 100, опередив Gemini 3.8 (58,5) и остальных.
Стоимость токенов
Самой экономичной оказалась GPT‑модель: за ответы потратила 35 тыс. токенов (≈ $0,35), что составляет 299 токенов за балл. На втором месте Gemini 3.8 Flash – 103 тыс. токенов, $0,39, 915 токенов за балл. Fable 5.1 стоила 110 тыс. токенов (~$5,54), а Kimi K3 – 472 тыс. токенов (~$7,09).
Где посмотреть детали
Все материалы, включая исходный код, записи игр и комментарии судей, доступны на https://ikorg.ru/rating/.



Комментарии 0