Автор Тема: Минцифра, Киевстар и UkrLLM  (Прочитано 1037 раз)

0 Пользователей и 2 Гостей просматривают эту тему.

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Минцифра, Киевстар и UkrLLM
« : 05, Июля 2025, Суббота, 06:40:40 am »
17 июня Минцифры и « Киевстар » подписали меморандум о совместной разработке украинской большой языковой модели.

UkrLLM должна стать основой для создания цифровых продуктов с искусственным интеллектом в государственном и бизнес-секторе, что должно способствовать улучшению услуг для пользователей и повышению эффективности организаций.

Минцифры имеет амбициозные планы к 2030 году попасть в тройку мировых лидеров по степени готовности внедрения искусственного интеллекта, сейчас мы занимаем 63 место. Речь идет не только о престиже, но и об эффективности государственного аппарата, информационной безопасности, развитии образования и науки.

Михаил Федоров лаконично обозначил цель создания продуктов на основе национальной языковой модели: «Інтегруємо їх у „Дію“, „Мрію“ та армію».. То есть ИИ должно стать полноценным помощником для государства и граждан и стать такой же обыденной и незаменимой вещью как «Дія».

Несмотря на важность и амбициозность стремлений Минцифры, решение создать собственную большую языковую модель вызвало много беспокойств относительно бюджета и масштабности проекта. Минцифры сразу сообщило, что с нуля создавать LLM никто не планирует, а будут принимать готовое решение, которое будет потом совершенствоваться под нужды государства. Именно для этого был создан AI Center Excellence, курирующий разработку национальной LLM. Да, именно курирует, поскольку руководство государства решило не тратить и без того ограниченные средства, а привлечь частную компанию в лице телеком-оператора «Киевстар».

Почему выбрали именно «Киевстар» и сколько будет стоить разработка?

Минцифры уверяет, что «Киевстар» владеет необходимыми ресурсами, как финансовыми, так и техническими для реализации проекта национальной LLM. Действительно, разработка модели требует немалых финансовых вливаний, например, Болгария потратила $100 млн на разработку первой в Европе национальной LLM. Поскольку Минцифры выбрало метод continuous pretraining с последующим fine-tuning (использование существующих open-source моделей и их обучение на корпусах украинского языка) смета модели значительно снижается. «Киевстар» готов вложить $1,5–2 млн начальных инвестиций. Для компании, которая недавно отчиталась об общем операционном доходе на уровне $255 млн, такие расходы почти незаметны. При необходимости «Киевстар» готов дополнительно инвестировать, но в каких объемах и чей предельный потолок неизвестно, однако по нашему запросу компания заверила, что полностью покроет финансовую часть разработки.

«Этот проект является классической R&D инициативой, по сути, разработкой чего-то, чего еще никто в таком виде не создавал. Это сопоставимо с научным экспериментом. Как в любых R&D проектах, могут возникнуть сложности, требующие дополнительных ресурсов, или наоборот — идеи, которые ускорят и удешевят работу. В то же время „ Киевстар“ взял на себя обязательство полностью покрыть финансовую часть разработки LLM», — прокомментировали в «Киевстар» вопрос о финансировании проекта LLM.

Если ориентироваться на оценку, которую дал CTO AI Center Excellence Дмитрий Овчаренко, общая смета может составить от $1,5 до $8 млн. Это очень оптимистичные суммы, если сравнивать с болгарским бюджетом или даже бразильским, на языковую модель которой выделено $200 млн.

Важно отметить, что материнская компания «Киевстар» VEON уже реализовала проекты по созданию большой языковой модели Казахстана KazLLM совместно с Barcelona Computing Center и другими частными компаниями. Поэтому выбор Минцифры ориентировался не только на привлекательную финансовую составляющую, но и на экспертность VEON в этой сфере.

"Киевстар" имеет прямой доступ к международной экспертизе через материнскую компанию VEON, которая уже обладает успешным опытом реализации национальных AI-проектов. Мы используем экспертизу группы для того, чтобы избегать характерных сложностей - как технических, так и организационных. Это позволяет "Киевстар" выступить надежным технологическим партнером на этапе создания LLM, максимально адаптированной к лингвистическим чертам и культуре Украины».

Как отмечалось ранее, не только Украина пошла по методу привлечения частных подрядчиков в создании собственной LLM. В целом крупные корпорации такие как Mistral во Франции, Fujitsu в Японии или Samsung в Республике Корея не гнушаются инвестировать в государственные LLM инициативы. В Таиланде и Греции привлекали всех, у кого были деньги, даже международные, а не локальные компании. Да, есть случаи, когда государство пытается создать большую языковую модель собственными силами, как в Нидерландах, где к созданию модели, планируется привлечь три неприбыльных организации, связанные с правительством. Однако это исключение, подтверждающее правило, поскольку одна из самых богатых стран Саудовская Аравия тоже обратилась в частные организации. 

Для обучения большой языковой модели необходимы три основных аппаратных компонента: высокопроизводительные графические процессоры, достаточный объем памяти и масштабируемое хранилище данных. Основным требованием является вычислительная мощность, обеспечиваемая современными графическими процессорами, предназначенными для параллельной обработки. Графические процессоры NVIDIA A100 или H100 являются распространенным выбором благодаря тензорным ядрам и высокой пропускной способности памяти, которые ускоряют матричные операции, критичные для обучения нейронным сетям.

По словам Овчаренко, сейчас локально тестируются тензорные видеокарты Nvidia на чипах H100 и менее мощные GPU. По запросу dev.ua «Киевстар» подтвердила использование чипов А100 или Н100 для первой фазы обучения LLM, а для финальной модели будут использоваться Н100 или Н200 от Nvidia, однако пока неизвестно откуда будут браться эти мощности. 

«По предварительным оценкам, проверенным с несколькими командами, имеющими опыт подобных проектов, на пике будет использоваться по меньшей мере 8 DGX, это 64 мощных GPU, каждый DGX по существу является готовым суперкомпьютером, созданным специально для сложных задач, таких как обучение. решение», — сообщила «Киевстар».

На чем будет основываться национальная LLM?

Есть множество open-source моделей готовых к использованию в качестве основы для кастомной национальной большой языковой модели. В Минцифре пока не назвали, какая именно модель будет использована, скорее всего, выбор упадет на Google Gemma-2, как это сделала Болгария в своей модели BgGPT, поскольку она прекрасно справилась с болгарским языком, использующим кириллицу.

В этом аспекте ключевую роль играет токенизатор, разбивающий текст на меньшие части, называемые токенами.

Токенизаторы популярных LLM типа ChatGPT, Llama, Claude, Gemini и других прежде всего разработаны для работы с английским языком, поэтому когда пользователь делает запросы на украинском, стоимость этого запроса намного выше.

Следующим важным этапом станет объем данных (корпусов), на которых будут тренировать модель.

Крупнейшим ресурсом считается «Корпус украинского языка», содержащий более 100 млн словоупотреблений . активно используется для создания токенизаторов для украинского языка.

Интересен факт, что в мире уже создана первая украинская языковая модель, но это произошло не в Украине и не украинцами. Компания разработчик BgGPT INSAIT создала модель MamayML, разрабатываемую специально под украинский язык. В то же время модель тренирована на значительно меньшем корпусе, среди которых есть вышеупомянутый «Малыш». MamayML показала лучшие результаты в бенчмарке по сдаче ВНО среди моделей аналогичного размера, при этом опережая гораздо более крупные модели, включая Gemma2 27B, Llama 3.1 70B и Qwen 2.5 72B.

Где будут использовать национальную LLM?

По всем громким заявлениям и намерениям Минцифры относительно важности национальной большой языковой модели для государственной безопасности, исторической памяти и движения в светлое цифровое будущее Украины следует действительно понимать, что из этого будут иметь украинские граждане.

В марте этого премьер-министр Денис Шмигаль сообщил , что за три года правительство сократило 30% чиновников, в частности, благодаря цифровизации услуг. Минцифры, со своей стороны, отмечает, что украинская LLM автоматизирует множество процессов в общении гражданина с государством. Например, возьмем «Дію», в которую ежемесячно поступает около 100 000 запросов от граждан, что создает большую нагрузку для команды поддержки. Собственная LLM позволит отдать эти операции ИИ агентам разработанным на основе национальной LLM и соответственно сократит штат работников, занимавшихся этим функционалом. Чатбот «Наталка» уже консультирует интегрирующих «Дію» партнеров и за три месяца работы виртуальная помощница проработала более 1500 запросов, что уменьшило нагрузку на менеджеров на 30%. Да, ИИ и здесь забирает работу.

Поскольку национальная LLM будет open-source, это позволит использовать ее бесплатно, но не для всех. Некоммерческие учреждения и бизнес смогут заплатить за доступ к модели, однако на каких условиях пока не ясно. В меморандуме между Минцифры и «Киевстар» отмечается, что стоимость будет значительно дешевле других аналогов банально из-за лучшей токенизации запросов на украинском языке. Коммерциализация проекта для бизнеса даст дополнительные средства в бюджет, которые, например, могут быть затраты на усиление обороноспособности страны.

После тестового периода модель будет передана государству и будет доступна open source. В то же время „Киевстар“ планирует в дальнейшем строить коммерческие решения с использованием модели, доступной как через АРИ, так и с возможностью развертывания на собственной инфраструктуре наших клиентов. Так, другие бизнесы смогут получить доступ в том числе к Kyivstar Cloud и созданным на ее основе продуктам от „Киевстар“ через API, с хостингом в  Kyivstar Cloud », – рассказали о дальнейшем использовании национальной LLM украинскими бизнесами после запуска.

На безопасности тоже следует остановиться, потому что это волнует сейчас каждого украинца. В общем, когда разрабатывают какое-то отдельное решение по запросу любого государства, это в первый вопрос не финансовой выгоды, а национальной безопасности. Правительства всех стран тратят космические суммы на контракты с частными подрядчиками. С последнего США заключили соглашение с OpenAI на $200 млн для внедрения ChatGPT в государственные структуры, в том числе для военных целей. ScaleAI, которую недавно приобрела Meta за рекордные $14,3 млрд, вообще натренировал языковую модель на основе Llama, способную отвечать на вопросы, связанные с обороной.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста


Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: Минцифра, Киевстар и UkrLLM
« Ответ #1 : 05, Июля 2025, Суббота, 13:04:13 pm »
Интересно, кто запатентует бренд UkrLLM?
#Приватбанк фашисты. В нём ненавидят людей старшего возраста


Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: Минцифра, Киевстар и UkrLLM
« Ответ #2 : 19, Июля 2025, Суббота, 06:55:31 am »
Скоро в Дії можна буде надіслати голосовий запит, наприклад, «відправ мені довідку про доходи за 2024 рік», і ШІ автоматично згенерує і відправить документ, — Федоров.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: Минцифра, Киевстар и UkrLLM
« Ответ #3 : 21, Июля 2025, Понедельник, 10:54:21 am »
Смотрел видео с одним из технических вождей Киевстар, который утверждает, что главный изюм в идее - обучить оупенсорсную LLM на неких данных, которых нет у OpenAI и других лидеров ИИ. Мне это напомнило историю с Grok, которая транслирует взгляды Илона Маска, а по сути это попытка встроить цензуру и специфическую подачу истории. Например, о Волынской резне, ВОВ и т.д. Всё просто.

UPD. Я в комментариях спросил про успехи с суверенным мессенджером VEON, в ответ ожидаемо тишина. Там тоже был откровенный изначальный распил денег акционеров. Как и платежах с мобильного счёта. Можно меня забанить, но суть процессов это не отменит.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: Минцифра, Киевстар и UkrLLM
« Ответ #4 : 08, Августа 2025, Пятница, 14:00:40 pm »
А вот и распил денег из госбюджета
#Приватбанк фашисты. В нём ненавидят людей старшего возраста

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: Минцифра, Киевстар и UkrLLM
« Ответ #5 : 11, Августа 2025, Понедельник, 19:19:47 pm »
Федоров:

В Україні зʼявиться перша державна інфраструктура для розвитку ШІ — запускаємо AI Factory

Наша місія — до 2030 року увійти в топ-3 країни за рівнем розвитку та впровадження АІ. Один з ключових факторів для її втілення — наявність інфраструктури, на якій працюватимуть АІ-сервіси: обчислювальних кластерів, датасховищ тощо.

Починаємо роботу над проєктом AI Factory. Це перший великий крок України в питанні технічної інфраструктури для ШІ. Скоро в Україні з’являться найсучасніші «залізо» і софт у світі для тренування й роботи наших державних ШІ-сервісів.

Запити в державних AI-сервісах оброблятимуться швидше, а головне — наші дані залишатимуться всередині країни. Це критично важливо для технологічної безпеки України.

На AI Factory працюватимуть ключові державні сервіси зі штучним інтелектом, які створює WINWIN AI Center of Excellence при Мінцифрі. Насамперед AI-асистент у Дії. Згодом інфраструктуру використовуватимуть для AI-тьютора у Мрії, а в перспективі проєкт працюватиме на оборону, науку та медицину.

AI Factory — це:
✅Технологічна база. Обчислювальні кластери (GPU), серверні зали з водяним охолодженням, сховища даних та все необхідне для запуску ШІ на повну.
✅Програмне забезпечення. Середовища для тренування та розгортання моделей, інтерфейси для підготовки даних, моніторинг і автоматизація.
✅Дані. Інтеграція з реєстрами, інструменти для очищення, анотації і передавання даних — усе, щоб моделі мали доступ до якісної інформації.
✅Командна експертиза. Програми підготовки технічних фахівців, які створюватимуть і впроваджуватимуть AI-продукти для держави та оборони.

Власна інфраструктура — фундамент AI-суверенітету України, який створює можливості для безпечного запуску AI-продуктів для громадян, Сил оборони та державного сектору.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста