Search
Search titles only
By:
Search titles only
By:
Log in
Register
Search
Search titles only
By:
Search titles only
By:
Menu
Install the app
Install
Forums
New posts
All threads
Latest threads
New posts
Trending threads
Trending
Search forums
What's new
New posts
New ads
New profile posts
Latest activity
Free Ads
Latest reviews
Search ads
Members
Current visitors
New profile posts
Search profile posts
Contact us
Latest ads
Ad icon
Jobreceive.com for sale
Blogerwiki
Updated:
Tuesday at 8:55 PM
Post Your Vehicle for Sale — FREE! - https://libro.lk
Kalu_Puth
Updated:
Tuesday at 7:38 PM
ඔයාගෙ Assignment හෝ Thesis එක හරියට හදාගමු
ErMurazor
Updated:
Saturday at 10:52 PM
Ad icon
BlackWall V2ray servers
hu KANNA
Updated:
Sep 23, 2026
Peppa Pig Family Plush Toy Set – 5 Characters
anil1961
Updated:
Sep 19, 2026
Electronics
Vehicles
Property
Search
Reply to thread
Forums
General
ElaKiri Talk!
Sinhala TTS [text2speech] Free Generate කරගන්න
Get the App
JavaScript is disabled. For a better experience, please enable JavaScript in your browser before proceeding.
You are using an out of date browser. It may not display this or other websites correctly.
You should upgrade or use an
alternative browser
.
Message
<blockquote data-quote="MihiCherub" data-source="post: 30954467" data-attributes="member: 238676"><p><strong><span style="font-family: 'trebuchet ms'"><span style="font-size: 18px">Sinhala TTS [text2speech] Free Generate කරගන්න</span></span></strong></p><p></p><p><img src="https://i.imgur.com/CB31XqV.png" alt="" class="fr-fic fr-dii fr-draggable " style="width: 379px" /></p><p></p><p>කලින් version එකට වඩා තවත් වැඩිපුර steps 44,000ක් finetune කලා. පැය 16ක් එක දිගට train කලා. </p><p></p><p>[MEDIA=soundcloud]mihicherub/1e4ft_u1#track_id=2168571252[/MEDIA]</p><p></p><p>version 1 එක මීට කලින් release කලා. ඒක audio clip 985 ක් length එක පැය 2 ක dataset එකක් use කරල steps 4600 ක් epoch 300ක් වගේ තමයි train කලේ. පැය 8ක් වගේ. v1 train එකේදි සිංහල වෙනුවට romanized letters use කරල තියෙන්නෙ. phonemizer use කරල නෑ. රොබොටික් සවුන්ඩ් එක ටිකක් තියෙනව. learning rate එක 1e-4 වලින් train කලේ.</p><p></p><p>මේ තියෙන්නෙ ඒකෙන් generate කරපුව.</p><p></p><p>[MEDIA=streamable]1rk28f[/MEDIA]</p><p></p><p>[MEDIA=soundcloud]mihicherub/output_02#track_id=2165600457[/MEDIA]</p><p></p><p>[MEDIA=soundcloud]mihicherub/output_05#track_id=2165605245[/MEDIA]</p><p></p><p>දෙවෙනි release එකේදි audio clip 3300 ක් length එක පැය 7 ක dataset එකක් use කරල steps 44,000 ක් epoch 300ක් train කරල තියෙනව. පැය 16ක් වගේ. මේක ඉතින් මෙහෙම කිව්වට පලවෙනිම training එකෙන්ම හොද output ආවෙ නෑ. සමහර training පැය 6-7 ගිහිල්ලත් එකම වචනයක් generate කරන්න බැරි උන checkpoints තිබ්බ. configuration ගොඩක් tricky. පොඩි වෙනස්කමකින් output එක සෑහෙන්න වෙනස් වෙනව. v2 train එකේදි සිංහල unicode ම තමයි පාවිච්චි කරල තියෙන්නෙ. romanized කරගැනිමේ අවශ්යතාවයක් නෑ. dataset එකේ numbers, english words ඇතුලත් කරල නැහැ. ඒ නිසා numbers ඕනෙ නම් ඒක සින්හලෙන් ටයිප් කරගන්න ඕනෙ. (15-පහලව) මේක දිනවලටත් එහෙමයි. (2025-දෙදහස් විසිපහ). ඉන්ග්රීසි වචන ඕනෙ වෙනව නම් ඒකත් සින්හලෙන් ටයිප් කරගන්න වෙනව. </p><p></p><p>මුලින්ම v2 training එක කලේ LR 1e-3. මේ learning rate එකෙන් pre learned prosody/generalizations සම්පූර්ණයෙන්ම destroy උනා. model එකට වචනයක් generate කරගන්න බෑ. too aggressive adaptation.</p><p>ඊලගට LR 1e-4 train කලා. steps 24,000 ගියාට පස්සෙ mel loss ~23ට අඩු වෙන්නෙම නෑ. model එක අලුතෙන් ඉගෙන ගන්න එක නැවතුනා. steps 24,000 checkpoint එක එච්චර සාර්තක නෑ. වචන පැහැදිලි නෑ. අලුතෙන් ඉගෙන ගන්නෙත් නෑ. ඒ training එක නවත්තල,</p><p>ඊලගට LR 1e-5 train කලා .මේකෙන් steps 20,000 ගිහිල්ලත් වචන හොයාගන්න බෑ. හැබැයි model එක learn වෙනව. පට්ට ස්ලෝ. steps 250,000 ක් වත් train කරන්න වෙනව. හැබැයි ඒක සුපිරියටම එන්න පුලුවන් (under the assumption). එච්චර කරන්න තව කොහෙද resources. result guaranteed නෑනෙ. </p><p></p><p>ඒකත් නවත්තල hybrid training එකක් කලා. කලින් LR 1e-4 වලින් train කරල steps 24,000 stop කරපු checkpoint එක අරන් ඒක finetune කලා LR 1e-5 වලින් තව steps 20,000 ක්. ඔන්න එතකොට හොද output එකක් ආව. මේ checkpoint එකත් තාම learn වෙනව. ඒ කියන්නෙ තව finetune කරන්න පුලුවන්. හැබැයි පොඩි ප්රශ්නයක් තියෙනව LR 1e-4 වලින් train කරපු steps ගාන වැඩියි. සමහර timber adaptation fast වෙලා තියෙනව. quick weights updating. “overwrite” phoneme mappings. සමහර වචන වල බ්ලබ් ගතියක් තියෙනව. (subtle mispronunciations or strange intonation) LR 1e-4 වලින් steps 4000-8000ක් වගේ train කරල fast adaptation එකක් කරගෙන phoneme pronunciation stability එක තියාගෙන LR 1e-5 වලින් steps 40,000 finetune කරගත්ත නම් මීට වඩා voice එක smooth වෙන්න පුලුවන්. (Avoids abrupt forgetting of base model phonemes-under the assumption) දැන් ඒව කරන්න resource නෑ. කවුරු හරි කැමති කෙනෙක් ඉන්නව නම් guide එකක් දුන්නෙ.</p><p></p><p>[MEDIA=soundcloud]mihicherub/full_enh#track_id=2168433642[/MEDIA]</p><p></p><p>model card එකෙන් මේක locally run කරගන්නෙ කොහොමද කියල ඔක්කොම විස්තර ටික දාල තියෙනව. try කරල බලන්න. මේක run කරන්න gpu එකක් ඕනෙ නෑ. cpu එකෙන් උනත් generate කරගන්න පුලුවන්. (gpu=True flag එක අයින් කරන්න). 4GB gpu එකකින් තත්පර 10 audio එකක් generate කරගන්න තත්පර 2-3ක් වගේ යන්නෙ. මේවත් image generate කරන models වගේම තමා. එකම text එක දුන්නට seed value එක වෙනස් වෙවී එක එක විදියෙ output එන්නෙ. output ඔක්කොම cherry picked කරල තියෙන්නෙ. මේකෙත් තව පොඩි පොඩි ප්රශ්න තියෙනව. තව steps 100,000ක් වත් finetune කරගන්න පුලුවන් නම් මීටත් වඩා output එක smooth වෙයි කියල හිතනව. එච්චර compute කරන්න තරම් මට resource නෑ. පින්වතෙක් runpod instance එකක් දෙනව නම් තව finetune කරන්න තිබ්බ.</p><p></p><p>Hugging Face</p><p><a href="https://huggingface.co/tharindumihi/tts-si-female-vits-v2" target="_blank">https://huggingface.co/tharindumihi/tts-si-female-vits-v2</a></p><p></p><p>ස්තුතියි</p></blockquote><p></p>
[QUOTE="MihiCherub, post: 30954467, member: 238676"] [B][FONT=trebuchet ms][SIZE=5]Sinhala TTS [text2speech] Free Generate කරගන්න[/SIZE][/FONT][/B] [IMG width="379px"]https://i.imgur.com/CB31XqV.png[/IMG] කලින් version එකට වඩා තවත් වැඩිපුර steps 44,000ක් finetune කලා. පැය 16ක් එක දිගට train කලා. [MEDIA=soundcloud]mihicherub/1e4ft_u1#track_id=2168571252[/MEDIA] version 1 එක මීට කලින් release කලා. ඒක audio clip 985 ක් length එක පැය 2 ක dataset එකක් use කරල steps 4600 ක් epoch 300ක් වගේ තමයි train කලේ. පැය 8ක් වගේ. v1 train එකේදි සිංහල වෙනුවට romanized letters use කරල තියෙන්නෙ. phonemizer use කරල නෑ. රොබොටික් සවුන්ඩ් එක ටිකක් තියෙනව. learning rate එක 1e-4 වලින් train කලේ. මේ තියෙන්නෙ ඒකෙන් generate කරපුව. [MEDIA=streamable]1rk28f[/MEDIA] [MEDIA=soundcloud]mihicherub/output_02#track_id=2165600457[/MEDIA] [MEDIA=soundcloud]mihicherub/output_05#track_id=2165605245[/MEDIA] දෙවෙනි release එකේදි audio clip 3300 ක් length එක පැය 7 ක dataset එකක් use කරල steps 44,000 ක් epoch 300ක් train කරල තියෙනව. පැය 16ක් වගේ. මේක ඉතින් මෙහෙම කිව්වට පලවෙනිම training එකෙන්ම හොද output ආවෙ නෑ. සමහර training පැය 6-7 ගිහිල්ලත් එකම වචනයක් generate කරන්න බැරි උන checkpoints තිබ්බ. configuration ගොඩක් tricky. පොඩි වෙනස්කමකින් output එක සෑහෙන්න වෙනස් වෙනව. v2 train එකේදි සිංහල unicode ම තමයි පාවිච්චි කරල තියෙන්නෙ. romanized කරගැනිමේ අවශ්යතාවයක් නෑ. dataset එකේ numbers, english words ඇතුලත් කරල නැහැ. ඒ නිසා numbers ඕනෙ නම් ඒක සින්හලෙන් ටයිප් කරගන්න ඕනෙ. (15-පහලව) මේක දිනවලටත් එහෙමයි. (2025-දෙදහස් විසිපහ). ඉන්ග්රීසි වචන ඕනෙ වෙනව නම් ඒකත් සින්හලෙන් ටයිප් කරගන්න වෙනව. මුලින්ම v2 training එක කලේ LR 1e-3. මේ learning rate එකෙන් pre learned prosody/generalizations සම්පූර්ණයෙන්ම destroy උනා. model එකට වචනයක් generate කරගන්න බෑ. too aggressive adaptation. ඊලගට LR 1e-4 train කලා. steps 24,000 ගියාට පස්සෙ mel loss ~23ට අඩු වෙන්නෙම නෑ. model එක අලුතෙන් ඉගෙන ගන්න එක නැවතුනා. steps 24,000 checkpoint එක එච්චර සාර්තක නෑ. වචන පැහැදිලි නෑ. අලුතෙන් ඉගෙන ගන්නෙත් නෑ. ඒ training එක නවත්තල, ඊලගට LR 1e-5 train කලා .මේකෙන් steps 20,000 ගිහිල්ලත් වචන හොයාගන්න බෑ. හැබැයි model එක learn වෙනව. පට්ට ස්ලෝ. steps 250,000 ක් වත් train කරන්න වෙනව. හැබැයි ඒක සුපිරියටම එන්න පුලුවන් (under the assumption). එච්චර කරන්න තව කොහෙද resources. result guaranteed නෑනෙ. ඒකත් නවත්තල hybrid training එකක් කලා. කලින් LR 1e-4 වලින් train කරල steps 24,000 stop කරපු checkpoint එක අරන් ඒක finetune කලා LR 1e-5 වලින් තව steps 20,000 ක්. ඔන්න එතකොට හොද output එකක් ආව. මේ checkpoint එකත් තාම learn වෙනව. ඒ කියන්නෙ තව finetune කරන්න පුලුවන්. හැබැයි පොඩි ප්රශ්නයක් තියෙනව LR 1e-4 වලින් train කරපු steps ගාන වැඩියි. සමහර timber adaptation fast වෙලා තියෙනව. quick weights updating. “overwrite” phoneme mappings. සමහර වචන වල බ්ලබ් ගතියක් තියෙනව. (subtle mispronunciations or strange intonation) LR 1e-4 වලින් steps 4000-8000ක් වගේ train කරල fast adaptation එකක් කරගෙන phoneme pronunciation stability එක තියාගෙන LR 1e-5 වලින් steps 40,000 finetune කරගත්ත නම් මීට වඩා voice එක smooth වෙන්න පුලුවන්. (Avoids abrupt forgetting of base model phonemes-under the assumption) දැන් ඒව කරන්න resource නෑ. කවුරු හරි කැමති කෙනෙක් ඉන්නව නම් guide එකක් දුන්නෙ. [MEDIA=soundcloud]mihicherub/full_enh#track_id=2168433642[/MEDIA] model card එකෙන් මේක locally run කරගන්නෙ කොහොමද කියල ඔක්කොම විස්තර ටික දාල තියෙනව. try කරල බලන්න. මේක run කරන්න gpu එකක් ඕනෙ නෑ. cpu එකෙන් උනත් generate කරගන්න පුලුවන්. (gpu=True flag එක අයින් කරන්න). 4GB gpu එකකින් තත්පර 10 audio එකක් generate කරගන්න තත්පර 2-3ක් වගේ යන්නෙ. මේවත් image generate කරන models වගේම තමා. එකම text එක දුන්නට seed value එක වෙනස් වෙවී එක එක විදියෙ output එන්නෙ. output ඔක්කොම cherry picked කරල තියෙන්නෙ. මේකෙත් තව පොඩි පොඩි ප්රශ්න තියෙනව. තව steps 100,000ක් වත් finetune කරගන්න පුලුවන් නම් මීටත් වඩා output එක smooth වෙයි කියල හිතනව. එච්චර compute කරන්න තරම් මට resource නෑ. පින්වතෙක් runpod instance එකක් දෙනව නම් තව finetune කරන්න තිබ්බ. Hugging Face [URL]https://huggingface.co/tharindumihi/tts-si-female-vits-v2[/URL] ස්තුතියි [/QUOTE]
Insert quotes…
Verification
Hath warak paha keeyada? (hatha wadikireema paha)
Post reply
Top
Bottom