/ Бенчмарки
BenchMIRT показывает, что на самом деле измеряют тесты LLM
3 недели назад
Настройки API почти втрое улучшили результат GPT-5.6 Sol
1 месяц назад
VoiceEQ проверяет, действительно ли голосовой ИИ звучит как человек
2 месяца назад
Perplexity открыла бенчмарк WANDR для исследовательских ИИ-агентов
2 месяца назад
Аудит OpenAI выявил серьёзные недостатки в SWE-Bench Pro
2 месяца назад
OpenAI представила GeneBench-Pro для тестирования ИИ в биологии
2 месяца назад