Україна робить масштабний крок у напрямі технологічного суверенітету — триває активна розробка першої національної великої мовної моделі (LLM) під назвою «Сяйво». Проєкт реалізується на засадах публічно-приватного партнерства між WINWIN AI Center of Excellence при Мінцифрі та компанією «Київстар» – розповідає dou.
Головна мета ініціативи — створити якісну, безпечну та глибоко інтегровану в український контекст мовну модель, яка стане основою для державних цифрових сервісів та відкриє нові можливості для вітчизняного бізнесу й науковців.
Фінансування без залучення держбюджету
Важливою особливістю проєкту є його фінансова модель. Створення «Сяйва» не потребує витрат із Державного бюджету України.
Усі витрати на технічну інфраструктуру, обчислювальні потужності, організацію процесів та залучення фахівців взяла на себе компанія «Київстар». Стартувавши у червні 2025 року, проєкт демонструє ефективний приклад співпраці держави та приватного сектору у сфері високих технологій.
Технологічна база та національний корпус даних
В основу «Сяйва» покладено архітектуру відкритиної моделі Gemma 3 від Google, яку розробники адаптують під особливості української мови, граматики та культурного контексту.
Для якісного навчання ШІ формується унікальний національний корпус даних. Інформацію збирають з понад 90 джерел, серед яких:
- державні установи та архіви (зокрема Укрдержархів вже надав понад 10 ТБ документів);
- провідні заклади вищої освіти та наукові організації;
- національні медіа.
Значна частина архівних та наукових документів оцифровується спеціально для цього проєкту. Паралельно команда розробляє юридичну базу, що визначатиме чіткі правила використання даних та захисту інтелектуальної власності.
Комплексна система тестування та безпека
Щоб модель працювала точно та не генерувала упереджених чи хибних відповідей, створено експертний комітет із понад 70 фахівців. Оцінка моделі здійснюється за чотирма напрямами:
- Мовознавчий — перевірка грамотності, точності та багатого лексичного запасу української мови.
- Культурно-історичний — правильність інтерпретації української історії, традицій та сучасного контексту.
- Етико-правовий — відсутність дискримінації, упереджень та відповідність етичним нормам.
- Науково-технічний — стійкість до дезінформації, детекція та мінімізація «галюцинацій» ШІ.
- Окрім автоматизованих тестів, «Сяйво» проходитиме порівняльні оцінювання з міжнародними аналогами.
Плани запуску та відкритість (Open Source)
Очікується, що повноцінну тестову модель завершать до кінця грудня 2026 року, а вже у січні 2027 року вона може стати публічно доступною.
Після завершення тестування «Київстар» передасть модель державі. Базову версію «Сяйва» та зібрані датасети планують зробити Open Source. Це означає, що будь-який український розробник, стартап чи компанія зможуть використовувати її як основу для власних продуктів та донавчати під специфічні потреби.
Видання Українські IT новини зазначає, що для звичайних громадян «Сяйво» стане інтелектуальним «серцем» нових державних послуг — зокрема, на її базі планується запуск «Дія AI» та персонального освітнього AI-тьютора в застосунку «Мрія».
