
Фото до статті
Олександр Остапенко
Автор новин
Українські державні установи прагнуть покласти край ситуації, коли якість функціонування нейромереж із українською мовою оцінювалася суб’єктивно — покладаючись на маркетингові заяви розробників. Відтепер країна володіє власним інструментом для вимірювання: Ukrainian LLM Leaderboard, публічний рейтинг, який об’єктивно демонструє, наскільки ефективно певна модель насправді розуміє та генерує українську мову.

Ця ініціатива була започаткована центром компетенцій WINWIN AI при Міністерстві цифрової трансформації у співпраці з Українським католицьким університетом (УКУ) та мовною спільнотою lang-uk, як повідомляє портал Мінцифри.
Проблема, яку вирішує рейтинг
Штучний інтелект вже давно перетнув межу експериментальних досліджень і активно використовується в численних сервісах повсякденного життя — від державних застосунків до фінансових продуктів. Складність полягала в тому, що донедавна вибір моделі для подібних інтеграцій здійснювався практично навмання. Глобальні рейтинги традиційно фокусуються на тестуванні ШІ англійською мовою, а оцінка якості роботи з українською здійснювалася переважно через машинний переклад — метод, який приховує фактичні мовні помилки: кальки з російської, спотворені відмінки, а іноді й суттєві викривлення або дезінформацію про Україну.
Новий лідерборд покликаний замінити цю сліпу довіру точними кількісними вимірюваннями.
На яких завданнях перевіряють моделі
Методологія тестування була розроблена таким чином, щоб максимально точно відтворювати реальні сценарії застосування штучного інтелекту. Моделі мають продемонструвати свої здібності у виконанні таких завдань:
- трансформація, резюмування та стислий виклад великих текстових масивів;
- пошук відповідей у документах та вирішення логічних задач;
- формування тестів рівня шкільної програми, зіставних за складністю з тестами ЗНО;
- виконання математичних розрахунків та точне слідування складним інструкціям.
Усі результати тестування, вихідний код та набори даних є відкритими для загалу на платформі HuggingFace — кожен зацікавлений може самостійно порівняти моделі та перевірити методологію нарахування оцінок.
Хто стоїть за методологією
Розробкою критеріїв оцінювання займалася команда експертів УКУ та спільноти lang-uk — зокрема Юрій Панів і Дмитро Чаплінський, які понад десятиліття присвятили навчанню нейромереж розумінню української мови. Саме ця команда формує текстові масиви та створює інструменти, які згодом використовують розробники по всій країні. Цей підхід вже має підтверджену історію успіху: його застосовували під час навчання української мовної моделі Lapa LLM, а здобуті результати були представлені на міжнародних наукових конференціях.
Юрій Панів, аспірант УКУ та керівник проєкту розробки мовної моделі Lapa, пояснює мотивацію ініціативи так: до появи великих мовних моделей залишалося незрозумілим, наскільки добре вони насправді функціонують з українською — де їхні сильні сторони, а де слабкі місця, та яка модель є оптимальною для конкретних завдань. Метою лідерборду є надання відповідей на ці запитання шляхом інтеграції наявних бенчмарків української NLP-спільноти з новими розробками, щоб сприяти як бізнесу у виборі моделей, так і науковцям у їхній роботі.
Роман Кислий, Chief AI Officer WINWIN AI Center of Excellence, формулює логіку проєкту ще більш прямолінійно: неможливо ефективно керувати процесами, які не піддаються вимірюванню. Оскільки ШІ вже інтегрується в сервіси для мільйонів користувачів, рішення повинні базуватися на достовірних даних, а не на обіцянках — і лідерборд перетворює якість роботи моделі з українською мовою на публічний та верифікований факт.
Практична користь для держави, бізнесу та науки
Новий інструмент вирішує одночасно три важливі задачі. Держава отримує надійну інформаційну базу для прийняття рішень щодо технологічних рішень під час інтеграції ШІ в державні сервіси. Бізнес має можливість об’єктивно оцінити економічну доцільність впровадження тієї чи іншої моделі ще до укладення контракту. Наукова спільнота, у свою чергу, отримує уніфіковану систему координат для порівняння результатів своєї роботи.
Плани на розвиток платформи
Команда не зупиняється на досягнутому і планує розширювати функціонал лідерборду. Серед найближчих напрямків — додавання оцінки роботи моделей із візуальним контентом, аналіз етичності відповідей та дослідження вартості використання штучного інтелекту українською мовою. Особливу увагу розробники обіцяють приділити потребам державного сектору: наскільки коректно моделі обробляють адміністративні процедури та нормативні документи, а також чи забезпечується безпека їхньої роботи з персональними даними громадян.
Ознайомитися з актуальним рейтингом та провести тестування моделей можна на платформі HuggingFace.
Нагадаємо, нещодавно стало відомо, що українська мова демонструє найвищі темпи зростання серед LLM-моделей.
Головна > Новини > Мінцифра запускає рейтинг LLM-моделей за рівнем володіння українською мовою
