Sinhala TTS [text2speech] Free Generate කරගන්න
කලින් version එකට වඩා තවත් වැඩිපුර steps 44,000ක් finetune කලා. පැය 16ක් එක දිගට train කලා.
version 1 එක මීට කලින් release කලා. ඒක audio clip 985 ක් length එක පැය 2 ක dataset එකක් use කරල steps 4600 ක් epoch 300ක් වගේ තමයි train කලේ. පැය 8ක් වගේ. v1 train එකේදි සිංහල වෙනුවට romanized letters use කරල තියෙන්නෙ. phonemizer use කරල නෑ. රොබොටික් සවුන්ඩ් එක ටිකක් තියෙනව. learning rate එක 1e-4 වලින් train කලේ.
මේ තියෙන්නෙ ඒකෙන් generate කරපුව.
දෙවෙනි release එකේදි audio clip 3300 ක් length එක පැය 7 ක dataset එකක් use කරල steps 44,000 ක් epoch 300ක් train කරල තියෙනව. පැය 16ක් වගේ. මේක ඉතින් මෙහෙම කිව්වට පලවෙනිම training එකෙන්ම හොද output ආවෙ නෑ. සමහර training පැය 6-7 ගිහිල්ලත් එකම වචනයක් generate කරන්න බැරි උන checkpoints තිබ්බ. configuration ගොඩක් tricky. පොඩි වෙනස්කමකින් output එක සෑහෙන්න වෙනස් වෙනව. v2 train එකේදි සිංහල unicode ම තමයි පාවිච්චි කරල තියෙන්නෙ. romanized කරගැනිමේ අවශ්යතාවයක් නෑ. dataset එකේ numbers, english words ඇතුලත් කරල නැහැ. ඒ නිසා numbers ඕනෙ නම් ඒක සින්හලෙන් ටයිප් කරගන්න ඕනෙ. (15-පහලව) මේක දිනවලටත් එහෙමයි. (2025-දෙදහස් විසිපහ). ඉන්ග්රීසි වචන ඕනෙ වෙනව නම් ඒකත් සින්හලෙන් ටයිප් කරගන්න වෙනව.
මුලින්ම v2 training එක කලේ LR 1e-3. මේ learning rate එකෙන් pre learned prosody/generalizations සම්පූර්ණයෙන්ම destroy උනා. model එකට වචනයක් generate කරගන්න බෑ. too aggressive adaptation.
ඊලගට LR 1e-4 train කලා. steps 24,000 ගියාට පස්සෙ mel loss ~23ට අඩු වෙන්නෙම නෑ. model එක අලුතෙන් ඉගෙන ගන්න එක නැවතුනා. steps 24,000 checkpoint එක එච්චර සාර්තක නෑ. වචන පැහැදිලි නෑ. අලුතෙන් ඉගෙන ගන්නෙත් නෑ. ඒ training එක නවත්තල,
ඊලගට LR 1e-5 train කලා .මේකෙන් steps 20,000 ගිහිල්ලත් වචන හොයාගන්න බෑ. හැබැයි model එක learn වෙනව. පට්ට ස්ලෝ. steps 250,000 ක් වත් train කරන්න වෙනව. හැබැයි ඒක සුපිරියටම එන්න පුලුවන් (under the assumption). එච්චර කරන්න තව කොහෙද resources. result guaranteed නෑනෙ.
ඒකත් නවත්තල hybrid training එකක් කලා. කලින් LR 1e-4 වලින් train කරල steps 24,000 stop කරපු checkpoint එක අරන් ඒක finetune කලා LR 1e-5 වලින් තව steps 20,000 ක්. ඔන්න එතකොට හොද output එකක් ආව. මේ checkpoint එකත් තාම learn වෙනව. ඒ කියන්නෙ තව finetune කරන්න පුලුවන්. හැබැයි පොඩි ප්රශ්නයක් තියෙනව LR 1e-4 වලින් train කරපු steps ගාන වැඩියි. සමහර timber adaptation fast වෙලා තියෙනව. quick weights updating. “overwrite” phoneme mappings. සමහර වචන වල බ්ලබ් ගතියක් තියෙනව. (subtle mispronunciations or strange intonation) LR 1e-4 වලින් steps 4000-8000ක් වගේ train කරල fast adaptation එකක් කරගෙන phoneme pronunciation stability එක තියාගෙන LR 1e-5 වලින් steps 40,000 finetune කරගත්ත නම් මීට වඩා voice එක smooth වෙන්න පුලුවන්. (Avoids abrupt forgetting of base model phonemes-under the assumption) දැන් ඒව කරන්න resource නෑ. කවුරු හරි කැමති කෙනෙක් ඉන්නව නම් guide එකක් දුන්නෙ.
model card එකෙන් මේක locally run කරගන්නෙ කොහොමද කියල ඔක්කොම විස්තර ටික දාල තියෙනව. try කරල බලන්න. මේක run කරන්න gpu එකක් ඕනෙ නෑ. cpu එකෙන් උනත් generate කරගන්න පුලුවන්. (gpu=True flag එක අයින් කරන්න). 4GB gpu එකකින් තත්පර 10 audio එකක් generate කරගන්න තත්පර 2-3ක් වගේ යන්නෙ. මේවත් image generate කරන models වගේම තමා. එකම text එක දුන්නට seed value එක වෙනස් වෙවී එක එක විදියෙ output එන්නෙ. output ඔක්කොම cherry picked කරල තියෙන්නෙ. මේකෙත් තව පොඩි පොඩි ප්රශ්න තියෙනව. තව steps 100,000ක් වත් finetune කරගන්න පුලුවන් නම් මීටත් වඩා output එක smooth වෙයි කියල හිතනව. එච්චර compute කරන්න තරම් මට resource නෑ. පින්වතෙක් runpod instance එකක් දෙනව නම් තව finetune කරන්න තිබ්බ.
Hugging Face
https://huggingface.co/tharindumihi/tts-si-female-vits-v2
ස්තුතියි
කලින් version එකට වඩා තවත් වැඩිපුර steps 44,000ක් finetune කලා. පැය 16ක් එක දිගට train කලා.
version 1 එක මීට කලින් release කලා. ඒක audio clip 985 ක් length එක පැය 2 ක dataset එකක් use කරල steps 4600 ක් epoch 300ක් වගේ තමයි train කලේ. පැය 8ක් වගේ. v1 train එකේදි සිංහල වෙනුවට romanized letters use කරල තියෙන්නෙ. phonemizer use කරල නෑ. රොබොටික් සවුන්ඩ් එක ටිකක් තියෙනව. learning rate එක 1e-4 වලින් train කලේ.
මේ තියෙන්නෙ ඒකෙන් generate කරපුව.
දෙවෙනි release එකේදි audio clip 3300 ක් length එක පැය 7 ක dataset එකක් use කරල steps 44,000 ක් epoch 300ක් train කරල තියෙනව. පැය 16ක් වගේ. මේක ඉතින් මෙහෙම කිව්වට පලවෙනිම training එකෙන්ම හොද output ආවෙ නෑ. සමහර training පැය 6-7 ගිහිල්ලත් එකම වචනයක් generate කරන්න බැරි උන checkpoints තිබ්බ. configuration ගොඩක් tricky. පොඩි වෙනස්කමකින් output එක සෑහෙන්න වෙනස් වෙනව. v2 train එකේදි සිංහල unicode ම තමයි පාවිච්චි කරල තියෙන්නෙ. romanized කරගැනිමේ අවශ්යතාවයක් නෑ. dataset එකේ numbers, english words ඇතුලත් කරල නැහැ. ඒ නිසා numbers ඕනෙ නම් ඒක සින්හලෙන් ටයිප් කරගන්න ඕනෙ. (15-පහලව) මේක දිනවලටත් එහෙමයි. (2025-දෙදහස් විසිපහ). ඉන්ග්රීසි වචන ඕනෙ වෙනව නම් ඒකත් සින්හලෙන් ටයිප් කරගන්න වෙනව.
මුලින්ම v2 training එක කලේ LR 1e-3. මේ learning rate එකෙන් pre learned prosody/generalizations සම්පූර්ණයෙන්ම destroy උනා. model එකට වචනයක් generate කරගන්න බෑ. too aggressive adaptation.
ඊලගට LR 1e-4 train කලා. steps 24,000 ගියාට පස්සෙ mel loss ~23ට අඩු වෙන්නෙම නෑ. model එක අලුතෙන් ඉගෙන ගන්න එක නැවතුනා. steps 24,000 checkpoint එක එච්චර සාර්තක නෑ. වචන පැහැදිලි නෑ. අලුතෙන් ඉගෙන ගන්නෙත් නෑ. ඒ training එක නවත්තල,
ඊලගට LR 1e-5 train කලා .මේකෙන් steps 20,000 ගිහිල්ලත් වචන හොයාගන්න බෑ. හැබැයි model එක learn වෙනව. පට්ට ස්ලෝ. steps 250,000 ක් වත් train කරන්න වෙනව. හැබැයි ඒක සුපිරියටම එන්න පුලුවන් (under the assumption). එච්චර කරන්න තව කොහෙද resources. result guaranteed නෑනෙ.
ඒකත් නවත්තල hybrid training එකක් කලා. කලින් LR 1e-4 වලින් train කරල steps 24,000 stop කරපු checkpoint එක අරන් ඒක finetune කලා LR 1e-5 වලින් තව steps 20,000 ක්. ඔන්න එතකොට හොද output එකක් ආව. මේ checkpoint එකත් තාම learn වෙනව. ඒ කියන්නෙ තව finetune කරන්න පුලුවන්. හැබැයි පොඩි ප්රශ්නයක් තියෙනව LR 1e-4 වලින් train කරපු steps ගාන වැඩියි. සමහර timber adaptation fast වෙලා තියෙනව. quick weights updating. “overwrite” phoneme mappings. සමහර වචන වල බ්ලබ් ගතියක් තියෙනව. (subtle mispronunciations or strange intonation) LR 1e-4 වලින් steps 4000-8000ක් වගේ train කරල fast adaptation එකක් කරගෙන phoneme pronunciation stability එක තියාගෙන LR 1e-5 වලින් steps 40,000 finetune කරගත්ත නම් මීට වඩා voice එක smooth වෙන්න පුලුවන්. (Avoids abrupt forgetting of base model phonemes-under the assumption) දැන් ඒව කරන්න resource නෑ. කවුරු හරි කැමති කෙනෙක් ඉන්නව නම් guide එකක් දුන්නෙ.
model card එකෙන් මේක locally run කරගන්නෙ කොහොමද කියල ඔක්කොම විස්තර ටික දාල තියෙනව. try කරල බලන්න. මේක run කරන්න gpu එකක් ඕනෙ නෑ. cpu එකෙන් උනත් generate කරගන්න පුලුවන්. (gpu=True flag එක අයින් කරන්න). 4GB gpu එකකින් තත්පර 10 audio එකක් generate කරගන්න තත්පර 2-3ක් වගේ යන්නෙ. මේවත් image generate කරන models වගේම තමා. එකම text එක දුන්නට seed value එක වෙනස් වෙවී එක එක විදියෙ output එන්නෙ. output ඔක්කොම cherry picked කරල තියෙන්නෙ. මේකෙත් තව පොඩි පොඩි ප්රශ්න තියෙනව. තව steps 100,000ක් වත් finetune කරගන්න පුලුවන් නම් මීටත් වඩා output එක smooth වෙයි කියල හිතනව. එච්චර compute කරන්න තරම් මට resource නෑ. පින්වතෙක් runpod instance එකක් දෙනව නම් තව finetune කරන්න තිබ්බ.
Hugging Face
https://huggingface.co/tharindumihi/tts-si-female-vits-v2
ස්තුතියි