Meta маніпулювала бенчмарками нових AI-моделей — спільнота обурена

Потужні штучні інтелекти Llama 4 від Meta — зокрема спрощена версія Scout та більш складна Maverickопинилися в центрі скандалу, незважаючи на гучні заяви про їхню перевагу над GPT-4o та Gemini 2.0 Flash у ключових бенчмарках.

Про це повідомляє 360ua.news.

З’ясувалося, що високі показники, якими хизувалася компанія, були отримані не з публічної версії моделей, а з внутрішньої експериментальної модифікації, що недоступна звичайним користувачам. Це викликало хвилю обурення серед фахівців і спільноти в цілому.

Згідно з офіційним повідомленням компанії Meta, Maverick посіла друге місце в рейтингу ELO з результатом у 1417 балів — нібито обігнавши GPT-4o від OpenAI та майже наздогнавши Gemini 2.5 Pro. Однак спільнота на платформі LMArena, яка спеціалізується на порівнянні AI-моделей, швидко виявила, що в документації згадувалася інша, експериментальна версія моделі — Llama-4-Maverick-03-26-Experimental — і саме вона проходила тестування.

Цей факт Meta не оприлюднила одразу. Лише після хвилі запитань і критики компанія підтвердила, що бенчмарки, на які вона спиралася у маркетингових матеріалах, не відображають продуктивності загальнодоступної версії моделі. Це викликало різку негативну реакцію як у користувачів, так і у представників галузі, які розцінили такий підхід як навмисне введення в оману.

Адміністрація LMArena також не залишилася осторонь — компанію Meta було звинувачено у порушенні принципів прозорого тестування. Представники платформи заявили, що подібні маніпуляції підірвали довіру до об’єктивності рейтингу та оголосили про майбутні зміни у політиці допуску моделей до тестів. У нових умовах планується заборонити використання модифікованих версій, які не відповідають фактичним публічним релізам.

Читайте далі

Додаток Settly: українка створила сервіс для релокації у Велику Британію

Зміна місця проживання у Великій Британії традиційно залишається однією...

Президент України нагородив Ілона Маска орденом Свободи

Президент України Володимир Зеленський підписав Указ № 835/2026 про...

Українська ШІ-модель Rukopys OCR перевершила Gemini у розпізнаванні рукописного тексту

Українська ШІ-платформа Lapathoniia представила спеціалізовану модель Rukopys OCR, розроблену...

Національний рейтинг ШІ-моделей: якість української мови в LLM

Запуск Ukrainian LLM Leaderboard Центром компетенцій WINWIN AI при...

Зарплати DevOps, SRE, Security і SysAdmin в Україні: що змінилось улітку 2026

У травні–червні 2026 року було проведено чергове зарплатне опитування,...