Dziś udostępniamy AI Voice Generation v2 — studio do syntezy mowy i klonowania głosu oparte na wieloplatformowym stosie AI Suite v2. Wpisz dowolny tekst i usłysz go wypowiedzianego naturalnym głosem lub nagraj krótki fragment i stwórz spersonalizowany głos, który brzmi jak Twój, a następnie używaj go wielokrotnie. Idea jest prosta: zamień tekst na mowę — i sklonuj własny głos — bez wysyłania tekstu czy próbek głosu do chmury.
Co potrafi
Wklej zdanie, akapit lub cały scenariusz; wybierz głos; naciśnij generuj; i odtwórz naturalnie brzmiącą mowę. Wbudowany Amy głos działa całkowicie offline na Twoim urządzeniu po pobraniu niewielkiego modelu przy pierwszym użyciu — wyłącz sieć i nadal działa. Reguluj prędkość mówienia od 0,5× do 2,0× bez zmiany tonu, wybierz format wyjściowy i natychmiast odtwórz ostatni klip za pomocą odtwarzacza z falą dźwiękową z możliwością przewijania. Gdy efekt Ci się spodoba, zapisz go jako plik WAV lub MP3.
Chcesz konkretny głos? Nagraj lub wczytaj krótki klip referencyjny, a aplikacja stworzy spersonalizowany sklonowany głos — bez etapu treningu, bez studia. Twoje klony pojawiają się na górze listy wyboru głosów do natychmiastowego użycia, dzięki czemu spójny głos towarzyszy każdemu nagranemu klipowi.
Nowości w wersji 2
- Prawdziwa biblioteka głosów. Jeden wyszukiwalny wybór zawiera wbudowany głos offline, premium głosy w chmurze, wysokiej jakości neuronowe głosy na urządzeniu oraz twoje własne klony. Szybki filtr zawęża listę według nazwy lub języka podczas pisania, a odznaka pobierania pokazuje, które głosy pobierają pliki przy pierwszym użyciu.
- Klonowanie głosu, pierwszy klon za darmo. Nagraj 6–15 sekund czystej mowy (lub zaimportuj klip), nazwij głos i stwórz klon za pomocą darmowego silnika Chatterbox. Pojawia się on na górze wyboru bez odznaki Pro — prawdziwy, spersonalizowany głos, a nie wersja próbna.
- Silniki na każdą sytuację. Domyślnym silnikiem jest offline Piper, działający całkowicie na twoim urządzeniu. Pro odblokowuje więcej głosów Piper, kompatybilne z OpenAI głosy w chmurze (użyj własnego klucza) oraz neuronowe głosy na urządzeniu — Kokoro (lekki i szybki) oraz Parler-TTS — które pozostają lokalne. Opcja utrzymania załadowanych modeli oznacza, że powtarzane generacje pomijają czas ładowania.
- Odtwarzaj bez ponownej syntezy. Odtwarzacz fali dźwiękowej natychmiast odtwarza ostatni wygenerowany klip oraz twoje klipy referencyjne klonu, więc nigdy nie musisz generować ponownie tylko po to, by odsłuchać. Sam decydujesz, ile ostatnich klipów pozostaje w pamięci podręcznej.
- Odciążaj ciężką pracę, kiedy chcesz. Klonowanie wymaga dużej mocy obliczeniowej; jeśli ten komputer nie ma szybkiego GPU, możesz przenieść zadanie na AI Server w swojej sieci. Nawet wtedy twój klip referencyjny pozostaje zaszyfrowany na twoim urządzeniu — jednorazowa kopia jest wysyłana tylko do syntezy każdego żądania i nigdy nie jest przechowywana na serwerze.
- W 16 językach. Cały interfejs dostosowuje się do języka twojego systemu operacyjnego, z możliwością zmiany jednym kliknięciem w Ustawieniach, a także mówi i klonuje w wielu językach.
- Skryptowalny. Narzędzie bez interfejsu graficznego generuje mowę z terminala, do wsadowych lektorskich nagrań i automatyzacji na własnej infrastrukturze.
Darmowa wersja kontra Pro
Darmowy poziom jest naprawdę użyteczny samodzielnie — daje ci prawdziwy głos i prawdziwy sklonowany głos. Darmowa wersja zawiera offline Amy głos i twój pierwszy sklonowany głos, stworzony za pomocą darmowego silnika klonowania, bez limitu użytkowania i bez opłat za słowo. Wersja Pro dotyczy więcej wyboru: każdy drugi wbudowany głos, premium głosy chmurowe, wysokiej jakości neuronowe głosy na urządzeniu, zaawansowane silniki klonowania oraz nieograniczone klony poza pierwszym. Sam proces klonowania głosu to nie zablokowane za Pro — podstawowy silnik jest darmowy i możesz używać jednego klona w darmowym planie; Pro po prostu dodaje więcej klonów i więcej silników.
Dlaczego przetwarzanie na urządzeniu ma znaczenie
Scenariusze, narracja, głos brzmiący jak Twój — teksty i próbki głosowe, z którymi ludzie najchętniej pracują, to często dokładnie to, co nie może trafić do chmury osób trzecich. AI Voice Generation przenosi sztuczną inteligencję na Twój komputer: offline’owy głos Amy oraz Twoje klony na urządzeniu nie wysyłają niczego poza urządzenie, Twoje klipy referencyjne klonu i historia generowania są szyfrowane w spoczynku pod kluczem, który mogą odczytać tylko aplikacje AI Suite, i nie ma licznika znaków. Tylko opcjonalne głosy w chmurze i opcjonalne odciążenie klonu wysyłają cokolwiek online, a oba wymagają wyraźnej zgody. To ta sama zasada lokalna, priorytetowo traktująca prywatność, która stoi za wszystkim, co tworzy Software Tailor. [1].
Pobierz
AI Voice Generation v2 jest już dostępny na Microsoft Store dla Windows jako bezpłatne pobranie, z wersją Pro dostępną, gdy chcesz mieć pełną bibliotekę głosów i nieograniczoną liczbę klonów [2]. Dodatkowe wersje platform nie są prezentowane jako dostępne, dopóki nie zostanie potwierdzona publiczna ścieżka pozyskania. Przeczytaj pełną prezentację funkcji na strona produktu.