Вице-министр Ростислав Коняшкин рассказал о работе цифровых сервисов с казахским языком и нехватке качественных данных для обучения ИИ, передает Tizgin.kz.
На каком языке думает eGov
Во время брифинга в правительстве журналисты спросили Коняшкина, на каком языке «думает» eGov.
По словам вице-министра, портал eGov доступен на трёх языках. При этом модели искусственного интеллекта, используемые в eGov GPT, также понимают казахский, русский и английский языки.
«eGov доступен на трёх языках. Если говорить про eGov GPT – универсального ассистента на основе искусственного интеллекта, то его модели также понимают три языка: казахский, русский и английский», – ответил Коняшкин.
Не хватает данных на казахском
В ходе брифинга также подняли вопрос нехватки качественных датасетов для обучения искусственного интеллекта казахскому языку.
Один из крупнейших открытых наборов данных, по словам журналистов, создал Назарбаев Университет. Он включает около 1 200–1 300 часов записей на основе парламентских выступлений, однако не отражает региональные особенности произношения.
Коняшкин сообщил, что Казахстан разрабатывает собственные языковые модели KAZ-LLM и ALEM-LLM. При их обучении используются материалы из сфер образования и культуры, архивные данные и другой казахоязычный контент.
«В рамках обучения и разработки наших языковых моделей мы брали максимально возможное из сферы образования, культуры, архивных данных и того контента на казахском языке», – сказал вице-министр.
В Минцифры ждут больше контента
По словам Коняшкина, в идеале языковые модели должны обучаться на данных из интернета. Однако сейчас объём контента на английском языке значительно превышает количество материалов на казахском.
В связи с этим министерство заинтересовано в том, чтобы в интернете появлялось больше качественного казахоязычного контента. Как отметил вице-министр, это поможет расширить базу данных для обучения языковых моделей и повысить качество их работы.