Мінцифри представляє оцінку LLM-моделей за якістю знання української мови

Фото до статті

Олександр Остапенко

Автор новин

Українські державні установи прагнуть покласти край практиці, коли якість роботи нейромереж з українською мовою оцінювалася суб’єктивно — спираючись на маркетингові заяви розробників. Відтепер країна має власний інструмент для вимірювання: Ukrainian LLM Leaderboard, відкритий рейтинг, який об’єктивно демонструє, наскільки добре певна модель насправді розуміє та генерує українську мову.

Цю ініціативу було започатковано центром компетенцій WINWIN AI при Міністерстві цифрової трансформації України у співпраці з Українським католицьким університетом (УКУ) та мовною спільнотою lang-uk, як повідомляє портал Мінцифри.

Проблема, яку вирішує рейтинг

Штучний інтелект уже давно перетнув межі експериментальних розробок і функціонує у численних сервісах повсякденного використання — від державних програм до банківських продуктів. Проблема полягає в тому, що донедавна вибір моделі для таких інтеграцій здійснювався фактично навмання. Глобальні рейтинги зазвичай тестують ШІ англійською мовою, а якість роботи з українською перевіряли головним чином за допомогою машинного перекладу — методу, який приховує реальні мовні помилки: кальки-русизми, спотворені відмінки, а часом і фактичні викривлення чи дезінформацію про Україну.

Новий лідерборд покликаний замінити цю сліпу довіру на точні вимірювання.

На яких завданнях перевіряють моделі

Методологію тестування було розроблено таким чином, щоб вона максимально наближено відтворювала реальні сценарії застосування штучного інтелекту. Моделі мають продемонструвати свої здібності у таких аспектах:

  • здійснювати переклад, переказ та стислий виклад великих обсягів тексту;
  • виявляти відповіді в документах та вирішувати логічні завдання;
  • створювати тести рівня шкільної програми, зіставні за складністю з тестами ЗНО;
  • виконувати математичні розрахунки та точно дотримуватися детальних інструкцій.

Всі результати тестування, вихідний код та масиви даних є доступними для ознайомлення на платформі HuggingFace — кожен зацікавлений може самостійно порівняти моделі та перевірити, яким чином були розраховані оцінки.

Хто стоїть за методологією

Розробкою правил оцінювання займалася команда експертів УКУ та спільноти lang-uk — зокрема Юрій Панів і Дмитро Чаплінський, які вже понад десятиліття працюють над навчанням нейромереж розумінню української мови. Саме ця команда формує текстові масиви та створює інструменти, які надалі використовуються розробниками по всій країні. Підхід вже має підтверджений практичний досвід: його застосовували під час розробки української мовної моделі Lapa LLM, а результати були представлені на міжнародних наукових конференціях.

Юрій Панів, аспірант УКУ та керівник проєкту розробки мовної моделі Lapa, пояснює мотивацію ініціативи так: до появи великих мовних моделей було незрозуміло, наскільки ефективно вони працюють з українською — де їхні сильні сторони, а де наявні прогалини, і яка модель краще підходить для конкретних завдань. Мета лідерборду — надати відповіді на ці питання, об’єднавши наявні бенчмарки української NLP-спільноти з новими розробками, щоб допомогти як бізнесу у виборі моделей, так і дослідникам у їхній роботі.

Roman Kislyy, Chief AI Officer WINWIN AI Center of Excellence, формулює логіку проєкту ще прямолінійніше: керувати процесами, які не вимірюються, неможливо. Оскільки ШІ вже інтегрується у сервіси для мільйонів людей, рішення повинні базуватися на доказах, а не на обіцянках — і лідерборд перетворює якість функціонування моделі з українською мовою на загальнодоступний і верифікований факт.

Практична користь для держави, бізнесу та науки

Новий інструмент вирішує одразу три завдання. Держава отримує надійну базу даних для відбору технологічних рішень при інтеграції ШІ в державні сервіси. Бізнес може об’єктивно оцінити економічну доцільність впровадження тієї чи іншої моделі ще до укладання угоди. Дослідницька спільнота, у свою чергу, отримує єдину систему координат для порівняння результатів своєї роботи.

Плани на розвиток платформи

Команда не зупиняється на досягнутому і планує розширювати функціонал поточного лідерборду. Серед найближчих напрямків — додавання перевірки роботи моделей із візуальними даними, оцінка етичності відповідей та аналіз вартості використання штучного інтелекту українською мовою. Окрема увага розробників буде приділена потребам державного сектору: наскільки коректно моделі обробляють адміністративні процедури та нормативні тексти, а також наскільки безпечно вони працюють з особистими даними громадян.

Ознайомитись із поточним рейтингом та протестувати моделі можна на платформі HuggingFace.

Нагадаємо, нещодавно стало відомо, що українська мова демонструє найвищі темпи поширення в LLM-моделях.

Головна > Новини > Мінцифра запускає рейтинг LLM-моделей за рівнем володіння українською мовою

Джерело

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *