Стварэнне натуральнага камп'ютарнага голасу доўгі час тармазілася праз спецыфіку беларускай фанетыкі, дзе сэнс аднолькавых на пісьме слоў змяняецца ў залежнасці ад націску. Каб навучыць машыну разумець кантэкст сказа, распрацоўшчыкі прымянілі інавацыйны падыход. Гэта дазволіла пазбегнуць памылак вымаўлення, якія выдавалі штучнае паходжанне аўдыя.

Як паведамляюць стваральнікі адкрытага праекта BelVoice ў сваім тэлеграм-канале,
галоўнай перашкодай для якаснага пераўтварэння тэксту ў маўленне (Text-to-Speech) заставаліся амографы. Гэта словы, якія маюць аднолькавае напісанне, але розны націск: напрыклад, «мУка» і «мукА», «вУчыць» і «вучЫць», «гАды» і «гадЫ».
Традыцыйныя алгарытмы выкарыстоўвалі найбольш частотны варыянт са слоўніка зусім без уліку кантэксту. Такі падыход забяспечваў дакладнасць каля 92 %. На першы погляд лічба здаецца высокай, аднак для сінтэзу маўлення гэта крытычная хіба: васьміпрацэнтная хібнасць азначае, што
практычна ў кожным абзацы сістэма рабіла фанетычную памылку, якая неадкладна выдавала штучнасць голасу і рэзала слых карыстальніку.
Для вырашэння семантычнай задачы даследчыкі інтэгравалі ў працэс вялікія моўныя мадэлі (LLM). Аптымальным рашэннем стала архітэктура лічбавага аналізу з размеркаваннем роляў. Спачатку магутная нейрасетка (напрыклад, Gemini Pro 3.1) апрацоўвае звесткі з Граматычнай базы і Тлумачальнага слоўніка беларускай мовы. На аснове гэтага масіва ствараецца аптымізаваны промпт з выразнымі правіламі і лагічнымі маркерамі для меншай інферэнс-мадэлі, якая ўжо непасрэдна працуе з тэкстам карыстальніка.
Усе тэхнічныя інструкцыі па пабудове гэтага алгарытму распрацоўшчыкі адкрыта размясцілі на платформе GitHub.
Выбар фінальнай мадэлі для праекта праводзіўся на трох спецыялізаваных датасэтах: базе CommonVoice, сінтэтычным збалансаваным наборы 10/10 і першых пятнаццаці раздзелах кнігі Аркадзя Чарнышэвіча «Засценак Малінаўка» з цалкам ручной разметкай націскаў. Падрабязныя вынікі даследаванняў апублікаваныя на платформе Hugging Face.
Найлепшыя суадносіны хуткасці і якасці прадэманстравала мадэль Gemma 4‑31B без уключэння функцыі разважання, якая празмерна запавольвае працу. На выбарцы з 1090 складаных амографаў у натуральным літаратурным тэксце сістэма дапусціла ўсяго тры памылкі, дасягнуўшы дакладнасці ў 99,72 %.
Для параўнання, канкурэнтная мадэль Qwen3. 8‑27B на тым жа аб'ёме даных памылілася 25 разоў, а Mistral-small-4 зрабіла 182 памылкі з выніковай дакладнасцю каля 83 працэнтаў.
«Наша Нiва» — бастыён беларушчыны
ПАДТРЫМАЦЬСтвараецца база для распазнавання беларускага маўлення — далучыцца можа кожны
Ютуб пачаў рабіць аўтаматычныя субцітры для беларускамоўных відэа
Нейрасеткі ўсё яшчэ спатыкаюцца на беларускім маўленні. Беларусы хочуць падарыць штучнаму інтэлекту ідэальны голас
Ад Baldur’s Gate 3 да Minecraft: з'явіўся сайт-каталог, дзе сабраны 180 відэагульняў па-беларуску
Каментары