«Задача – подготовить единый датасет»: когда GigaChat заговорит на татарском

Как научить нейросети чувствовать тонкости национальной культуры и почему создание уникальных языковых баз данных – единственный способ сберечь живое наследие в эпоху искусственного интеллекта, – рассказал журналистам директор Института прикладной семиотики АН РТ Ринат Гильмуллин.

«Задача – подготовить единый датасет»: когда GigaChat заговорит на татарском изображение сгенерировано с помощью ChatGPT

ЧТОБЫ ЯЗЫК ЖИЛ – НУЖЕН КОНТЕНТ

Татарский язык стал одним из самых востребованных среди языков народов России в сервисах Яндекса. Ежемесячно пользователи переводят с него или на него почти 168,7 тысячи раз.

– В пятерку самых востребованных также входят башкирский язык с показателем 59 тысяч, чувашский – 38 тысяч, ногайский – 28,6 тысячи и якутский – 24 тысячи переводов, – привел данные Ринат Гильмуллин.

По словам ученого, это не просто лидерство, а закономерный итог системной работы и стратегического видения руководства республики и Академии наук РТ.

– Сохранение языка сегодня невозможно без его полноценной «цифровизации». Язык должен стать неотъемлемой частью популярных ИТ-продуктов. Что это значит на практике? Это целый спектр решений: перевод текстов и документов, распознавание текста на фото, а также внедрение технологий синтеза и распознавания речи – как в случае с голосовым вводом в клавиатуре Яндекса, – подчеркнул спикер.

По его словам, Академия наук РТ сотрудничает с данной компанией с 2014 года, в фокусе партнерства – совместная работа над данными. Ученые Татарстана также развивают сотрудничество со «Сбером». Одним из итогов этой работы стала адаптация GigaChat для татарского языка. Чтобы обучить ИИ, волонтеры Молодежного конгресса татар подготовили датасет (структурированная языковая база данных для обучения нейросетей), насчитывающий около миллиарда записей.

Важной площадкой для обмена опытом стала международная конференция TurkLang, проходящая с 2013 года. Мероприятие ежегодно собирает ведущих исследователей в сфере технологий обработки естественного языка и специалистов, внедряющих инновации в области искусственного интеллекта.

В сохранение культурного наследия активно вовлекают и молодежь. Уже шесть лет в Татарстане проходит «Татар.Бу Хакатон» – площадка, где школьники и студенты создают передовые ИТ-решения для развития татарского языка. За 2–3 дня участники разрабатывают прототипы приложений, чат-ботов, игр и ИИ-инструментов, которые помогают популяризировать родную культуру в цифровой среде.

– Чтобы язык полноценно жил в интернете, нам нужно создавать больше качественного контента на нем, – подчеркнул спикер.

НЕ БИБЛИОТЕКА, А «УМНЫЙ» РЕСУРС

Особое внимание Ринат Гильмуллин уделил национальному корпусу татарского языка «Туган тел» – масштабной цифровой базе, насчитывающей более 200 миллионов слов. Корпус включает тексты различных жанров: художественную литературу, СМИ, официальные документы, учебные и научные публикации. Каждый документ снабжен морфологической разметкой и подробным метаописанием (авторы, их пол, выходные данные, даты создания, жанры и структура).

– Это не просто библиотека текстов, а «умный» ресурс. Главная его особенность в том, что программные алгоритмы «понимают» каждое слово в этих текстах, – подчеркнул спикер.

Благодаря такой глубокой обработке данных, база стала незаменимым инструментом не только для ученых-филологов, но и для разработчиков. Именно на основе этих материалов создаются современные переводчики, электронные словари и другие полезные IT-сервисы для татарского языка.

Директор Института прикладной семиотики АН РТ также упомянул проект «Татсофт» (TatSoft). Этот сервис помогает татарскому языку «заговорить» в цифровом мире. Благодаря ему интерфейсы популярных приложений, сайтов и операционных систем становятся доступными и комфортными для носителей языка. Технологии платформы уже более пяти лет лежат в основе системы профессионального перевода Smartcat. Эффективность проекта подтверждают цифры. На сегодня «Татсофт» обработал более 40 миллионов запросов пользователей из 150 стран мира.

Помимо прочего, спикер рассказал о развитии приложения «Тиз.Яз». Это удобная татарская клавиатура для смартфонов, доступная для скачивания на Android и iOS. Разработчики делают всё, чтобы писать на татарском языке было так же просто, как на русском или английском. В приложении уже работает предиктивный ввод, который предугадывает следующее слово, и умный словарь, помогающий быстрее набирать текст без опечаток. Ожидается, что в ближайшее время появится и автоматическая проверка орфографии.

Гильмуллин отметил, что проблема особенно остра для молодежи.

– Многие привыкли набирать текст на русском, просто заменяя буквы или используя транслит. Это плохая привычка, которая ведет к небрежности и ошибкам в письме. Поэтому наша задача – внедрить систему, которая будет автоматически предлагать правильные варианты написания, помогая пользователям писать грамотно, не задумываясь об этом, – подчеркнул ученый.

Кроме того, для носителей языка и тех, кто его изучает, доступен сервис «Татарспич». Платформа умеет распознавать устную речь, переводить ее и синтезировать текст в аудиоформат.

С ЛОГИКОЙ У НЕЙРОСЕТЕЙ ПОКА ТУГО

Говоря о новых проектах, Ринат Гильмуллин отметил, что сейчас идет масштабное обновление электронного фонда словарей «Сүзлек». Это проект Института языка, литературы и искусства им. Ибрагимова Академии наук РТ, который реализуется при поддержке Комиссии при Раисе Республики Татарстан по вопросам сохранения и развития татарского языка.

– Здесь будет представлен совершенно новый интерфейс веб-сайта – современный. Плюс мы опубликуем эту версию в виде мобильного приложения, – отметил спикер.

Еще один крайне востребованный проект Академии наук РТ связан с голосовыми технологиями. Сейчас перед организацией стоит задача подготовить единый голосовой датасет, который в ближайшем будущем можно будет применять в самых разных сценариях.

– Это и поддержка GigaChat от Сбера – именно голосовая версия. Далее – умные устройства. Ну и есть еще сценарии, связанные с операторами, так называемыми, колл-центрами, – пояснил спикер.

На данный момент для речевой базы собрано около трех терабайт данных, которые еще предстоит обработать. Объем информации может показаться избыточным, но это необходимо для качества продукта.

– Нам важно, чтобы этот датасет покрывал все различные образцы, связанные с языком – это и диалекты, и тематическое разнообразие. Здесь предстоит очень большая работа. Развитие татарского языка в цифровой среде – безусловный успех, однако сегодня перед специалистами стоят новые, более сложные вызовы, отметил Гильмуллин. Современные нейросети и чат-боты обучаются на колоссальных массивах данных, где доминируют мировые языки. И если с простым переводом на татарский алгоритмы справляются неплохо, то в вопросах истории и культуры они часто допускают серьезные ошибки.

– Большие языковые модели хорошо справляются с переводом на татарский. Но когда дело доходит до логических выводов, исторических фактов или культурных нюансов, они совершают серьезные ошибки. Это главная проблема, которую нам предстоит решить. Сегодня недостаточно просто «загрузить» язык в интернет – важно обеспечить его полноценное и качественное звучание в цифровом мире, – пояснил ученый.

Ринат Гильмуллин уточнил, что большинство нейросетей разработаны за рубежом, и если мы не будем работать с собственными данными, то рискуем потерять аутентичность нашего наследия.

– Системная работа в этом направлении – единственный способ отстоять технологический суверенитет и сберечь нашу культурную самобытность, – подчеркнул он.

Не пропустите самое интересное в Max и Telegram-канале газеты «Республика Татарстан»

Больше статей и новостей в «Дзен»

татарский язык Академия наук РТ Яндекс новости Татарстана ученые татарстана искусственный интеллект нейросети родные языки смартфон День языков народов России
Вы уже оставили реакцию
Новости Еще новости