Sinhala TTS [text2speech] Free Generate කරගන්න

MihiCherub

Well-known member
  • Sep 14, 2009
    18,918
    1
    9,715
    113
    Gampaha
    Sinhala TTS [text2speech] Free Generate කරගන්න

    CB31XqV.png


    කලින් version එකට වඩා තවත් වැඩිපුර steps 44,000ක් finetune කලා. පැය 16ක් එක දිගට train කලා.



    version 1 එක මීට කලින් release කලා. ඒක audio clip 985 ක් length එක පැය 2 ක dataset එකක් use කරල steps 4600 ක් epoch 300ක් වගේ තමයි train කලේ. පැය 8ක් වගේ. v1 train එකේදි සිංහල වෙනුවට romanized letters use කරල තියෙන්නෙ. phonemizer use කරල නෑ. රොබොටික් සවුන්ඩ් එක ටිකක් තියෙනව. learning rate එක 1e-4 වලින් train කලේ.

    මේ තියෙන්නෙ ඒකෙන් generate කරපුව.







    දෙවෙනි release එකේදි audio clip 3300 ක් length එක පැය 7 ක dataset එකක් use කරල steps 44,000 ක් epoch 300ක් train කරල තියෙනව. පැය 16ක් වගේ. මේක ඉතින් මෙහෙම කිව්වට පලවෙනිම training එකෙන්ම හොද output ආවෙ නෑ. සමහර training පැය 6-7 ගිහිල්ලත් එකම වචනයක් generate කරන්න බැරි උන checkpoints තිබ්බ. configuration ගොඩක් tricky. පොඩි වෙනස්කමකින් output එක සෑහෙන්න වෙනස් වෙනව. v2 train එකේදි සිංහල unicode ම තමයි පාවිච්චි කරල තියෙන්නෙ. romanized කරගැනිමේ අවශ්‍යතාවයක් නෑ. dataset එකේ numbers, english words ඇතුලත් කරල නැහැ. ඒ නිසා numbers ඕනෙ නම් ඒක සින්හලෙන් ටයිප් කරගන්න ඕනෙ. (15-පහලව) මේක දිනවලටත් එහෙමයි. (2025-දෙදහස් විසිපහ). ඉන්ග්‍රීසි වචන ඕනෙ වෙනව නම් ඒකත් සින්හලෙන් ටයිප් කරගන්න වෙනව.

    මුලින්ම v2 training එක කලේ LR 1e-3. මේ learning rate එකෙන් pre learned prosody/generalizations සම්පූර්ණයෙන්ම destroy උනා. model එකට වචනයක් generate කරගන්න බෑ. too aggressive adaptation.
    ඊලගට LR 1e-4 train කලා. steps 24,000 ගියාට පස්සෙ mel loss ~23ට අඩු වෙන්නෙම නෑ. model එක අලුතෙන් ඉගෙන ගන්න එක නැවතුනා. steps 24,000 checkpoint එක එච්චර සාර්තක නෑ. වචන පැහැදිලි නෑ. අලුතෙන් ඉගෙන ගන්නෙත් නෑ. ඒ training එක නවත්තල,
    ඊලගට LR 1e-5 train කලා .මේකෙන් steps 20,000 ගිහිල්ලත් වචන හොයාගන්න බෑ. හැබැයි model එක learn වෙනව. පට්ට ස්ලෝ. steps 250,000 ක් වත් train කරන්න වෙනව. හැබැයි ඒක සුපිරියටම එන්න පුලුවන් (under the assumption). එච්චර කරන්න තව කොහෙද resources. result guaranteed නෑනෙ.

    ඒකත් නවත්තල hybrid training එකක් කලා. කලින් LR 1e-4 වලින් train කරල steps 24,000 stop කරපු checkpoint එක අරන් ඒක finetune කලා LR 1e-5 වලින් තව steps 20,000 ක්. ඔන්න එතකොට හොද output එකක් ආව. මේ checkpoint එකත් තාම learn වෙනව. ඒ කියන්නෙ තව finetune කරන්න පුලුවන්. හැබැයි පොඩි ප්‍රශ්නයක් තියෙනව LR 1e-4 වලින් train කරපු steps ගාන වැඩියි. සමහර timber adaptation fast වෙලා තියෙනව. quick weights updating. “overwrite” phoneme mappings. සමහර වචන වල බ්ලබ් ගතියක් තියෙනව. (subtle mispronunciations or strange intonation) LR 1e-4 වලින් steps 4000-8000ක් වගේ train කරල fast adaptation එකක් කරගෙන phoneme pronunciation stability එක තියාගෙන LR 1e-5 වලින් steps 40,000 finetune කරගත්ත නම් මීට වඩා voice එක smooth වෙන්න පුලුවන්. (Avoids abrupt forgetting of base model phonemes-under the assumption) දැන් ඒව කරන්න resource නෑ. කවුරු හරි කැමති කෙනෙක් ඉන්නව නම් guide එකක් දුන්නෙ.



    model card එකෙන් මේක locally run කරගන්නෙ කොහොමද කියල ඔක්කොම විස්තර ටික දාල තියෙනව. try කරල බලන්න. මේක run කරන්න gpu එකක් ඕනෙ නෑ. cpu එකෙන් උනත් generate කරගන්න පුලුවන්. (gpu=True flag එක අයින් කරන්න). 4GB gpu එකකින් තත්පර 10 audio එකක් generate කරගන්න තත්පර 2-3ක් වගේ යන්නෙ. මේවත් image generate කරන models වගේම තමා. එකම text එක දුන්නට seed value එක වෙනස් වෙවී එක එක විදියෙ output එන්නෙ. output ඔක්කොම cherry picked කරල තියෙන්නෙ. මේකෙත් තව පොඩි පොඩි ප්‍රශ්න තියෙනව. තව steps 100,000ක් වත් finetune කරගන්න පුලුවන් නම් මීටත් වඩා output එක smooth වෙයි කියල හිතනව. එච්චර compute කරන්න තරම් මට resource නෑ. පින්වතෙක් runpod instance එකක් දෙනව නම් තව finetune කරන්න තිබ්බ.

    Hugging Face
    https://huggingface.co/tharindumihi/tts-si-female-vits-v2

    ස්තුතියි
     

    luminarsft

    Member
    Sep 23, 2022
    11
    19
    3
    Locally ද train කරේ නැත්නම් GPU rent කරලද?
    Steps and learning rate එක වෙනස් කරලත් ලොකු improvement එකක් නැතිනම් data set එක quality මදි ඇති. error එක amplify වෙනව ඇති. learnin rate එකට වඩා steps වල ලොකු effect එකක් final output එකට තියෙනවා කියල මට හිතෙනවා. (Experience from SDXL).
    සමහර වෙලාවට steps ගාණ වැඩි වුනාම හෝ අඩු වුනාම හොද result එකක් එන්නෙ නෑ. ඒ වගේම train කරද්දිත් සමහර model epoches ගාණ වැඩි වෙද්දි quality එක අඩු වෙනව data set එකේ ගන්න තරම් details නැත්නම් , ---> ටිකක් overconfidence වෙනව වගේ. BTW Nice work!
     
    • Love
    Reactions: MihiCherub

    MihiCherub

    Well-known member
  • Sep 14, 2009
    18,918
    1
    9,715
    113
    Gampaha
    සිරා වැඩක්නේ
    මේක බන් හරියට හදලා පොඩි ගානක් අරගෙන සබ්ස්ක්‍රිප්ශන් එකක් විදියට දීපන්කෝ පට්ට සල්ලියක් හොයන්න පුලුවන් Youtube කරන සිංහලුන්ගෙන්
    මාසෙට 500-1000ක් වගේ අරගෙන විනාඩි 30ක් පැයක් වගේ දීපන්. runpod එකේ වගේ අර ලාබෙට තියන consumer gpu එකක් අරගෙන රන් කරන එකනේ තියෙන්නෙ

    මාත් locally AI රන් කරනවා. ගෙදර මැශින් තියනවා රන් කරන්න ඒත් TTS මගේ ස්පෙශල්ටි එකක් නෙමෙයි
    ඔවු ඒක ට්‍රයි කරන ගමන්. දැනට train කරපු model එක රිලීස් කලා free මේ ත්‍රෙඩ් එකේ.. ඕනෙ කෙනෙකුට අරන් තව finetune කරගන්න පුලුවන්. තෑන්ක්ස්
     
    • Like
    Reactions: infernocus

    MihiCherub

    Well-known member
  • Sep 14, 2009
    18,918
    1
    9,715
    113
    Gampaha
    Locally ද train කරේ නැත්නම් GPU rent කරලද?
    Steps and learning rate එක වෙනස් කරලත් ලොකු improvement එකක් නැතිනම් data set එක quality මදි ඇති. error එක amplify වෙනව ඇති. learnin rate එකට වඩා steps වල ලොකු effect එකක් final output එකට තියෙනවා කියල මට හිතෙනවා. (Experience from SDXL).
    සමහර වෙලාවට steps ගාණ වැඩි වුනාම හෝ අඩු වුනාම හොද result එකක් එන්නෙ නෑ. ඒ වගේම train කරද්දිත් සමහර model epoches ගාණ වැඩි වෙද්දි quality එක අඩු වෙනව data set එකේ ගන්න තරම් details නැත්නම් , ---> ටිකක් overconfidence වෙනව වගේ. BTW Nice work!
    gpu rent කරල කලේ. sweet spot එක හොයා ගන්න එක එච්චර අමාරු වැඩක් නෙමේ. steps 1000න් checkpoint එකක් save කරල ඒක evaluation කරල audio clips generate කරගන්න තියෙන්නෙ. එතකොට quality check එකක් training එකෙන්ම වෙනව. dataset එක pathnirvana ලගෙම dataset එක. ඒකෙ කොලිටි එකේ නම් අවුලක් නෑ. මම තවත් noise reduce කරල හදාගත්ත. ගූගල් එකෙන් collect කරපු dataset එකකුත් තියෙනව. ඒකෙ noise ටිකක් වැඩී. thanks
     

    dilann

    Well-known member
  • Jul 6, 2018
    67,040
    165,989
    113
    එකමත් එක රටක
    ඔවු ඒක ට්‍රයි කරන ගමන්. දැනට train කරපු model එක රිලීස් කලා free මේ ත්‍රෙඩ් එකේ.. ඕනෙ කෙනෙකුට අරන් තව finetune කරගන්න පුලුවන්. තෑන්ක්ස්
    එළකිරි උන්ට token එකක් දීල free දීපං මතක ඇතුව 🥱