soundWave
soundWave to dodatek do NVDA, który renderuje tekst do pliku audio przy użyciu zainstalowanych silników mowy.
Może eksportować dźwięk z tekstu znajdującego się w schowku, z pliku tekstowego, z folderu plików tekstowych albo z tekstu wpisanego bezpośrednio w dodatku.
Szybki start
- Naciśnij NVDA+Ctrl+=, aby otworzyć soundWave.
- Wybierz syntezator.
- Opcjonalnie ustaw bazowy folder nagrań. Jest to domyślny folder zapisu renderów; soundWave tworzy w nim foldery wyjściowe według szablonów nazewnictwa.
- Wybierz źródło tekstu: schowek, plik tekstowy, folder plików tekstowych albo tekst wpisany lub wklejony ręcznie.
- Skonfiguruj syntezator. Użyj przycisku Test, aby odsłuchać krótki podgląd wybranych ustawień.
- Wybierz nazwę pliku wyjściowego i format.
- Poczekaj na zakończenie renderowania, a następnie sprawdź podsumowanie.
W oknach renderowania soundWave naciśnij F1, aby otworzyć tę instrukcję.
W panelu soundWave w ustawieniach NVDA przejdź klawiszem Tab do przycisku Pomoc albo użyj skrótu Alt+H.
Kontrolki dialogów mają skróty klawiaturowe tam, gdzie jest to praktyczne, na przykład Alt+T dla przycisku Test.
Wejście i wyjście
- Wejście: tekst ze schowka, plik tekstowy, folder plików tekstowych albo tekst wpisany lub wklejony ręcznie.
- Wyjście: WAV jest zawsze obsługiwany. MP3, FLAC i M4A są dostępne, gdy ffmpeg jest zainstalowany i dostępny w systemowej zmiennej PATH.
- Tryb wsadowy: wybranie folderu renderuje każdy czytelny plik tekstowy jako osobny plik audio w kolejności sortowania. Domyślnie renderowanie wsadowe zapisuje pliki w podfolderze syntezatora i głosu, a nazwy plików otrzymują automatyczne numery porządkowe.
- Długie teksty: długi tekst jest renderowany w częściach. Jeśli jeden plik WAV byłby zbyt duży, soundWave zapisuje ponumerowane pliki części.
- Foldery i nazwy plików: soundWave może osobno nazywać foldery pojedynczego renderowania, pojedyncze pliki, foldery wsadowe i pliki wsadowe.
- Nazwy głosów: gdy soundWave potrafi rozpoznać wybrany głos, może użyć jego nazwy w szablonach folderów lub plików, aby łatwiej rozróżniać rendery tego samego tekstu z różnymi syntezatorami lub głosami.
Postęp renderowania
Podczas renderowania soundWave pokazuje okno postępu z przyciskiem Anuluj oraz opcjonalnymi szczegółami wiersz po wierszu.
Użyj przycisku Pokaż szczegóły, aby sprawdzić bieżący plik, fragment tekstu, czas działania, długość wyrenderowanego audio i współczynnik szybkości, jeśli te informacje są dostępne.
Długie czasy są pokazywane jako minuty albo godziny, a nie tylko jako liczba sekund.
Przy długich renderach użyj przycisku Minimalizuj albo skrótu Alt+M, aby ukryć okno postępu.
Renderowanie będzie działać w tle, a ukryte okno nie będzie przeszkadzać na liście Alt+Tab.
Naciśnij ponownie polecenie soundWave, NVDA+Ctrl+=, aby przywrócić aktywne okno postępu.
Ustawienia
Otwórz ustawienia NVDA i wybierz kategorię soundWave, aby ustawić domyślne opcje używane przez kolejne rendery.
- Domyślny folder zapisu: bazowy folder nagrań używany w pierwszym oknie soundWave. Pozostawienie pola pustego używa folderu Dokumenty\SoundWave, dzięki czemu wyrenderowane pliki trafiają w miejsce łatwe do odnalezienia.
- Nazywanie folderów i plików: osobne szablony kontrolują foldery pojedynczego renderowania, pojedyncze pliki, foldery wsadowe i pliki wsadowe. Poniższe tabele pokazują ustawienia domyślne, znaczniki i przykłady.
- Domyślny format wyjściowy: wybierz WAV albo MP3, FLAC lub M4A, gdy dostępny jest ffmpeg. Opcjonalne pola wyboru pozwalają pominąć okno Zapisz jako dla pojedynczego renderowania oraz wybór formatu dla trybu wsadowego.
- Po renderowaniu: wybierz, czy soundWave ma otworzyć folder wyjściowy po zakończeniu całego renderowania, odtworzyć plik audio w domyślnym odtwarzaczu albo pokazać podsumowanie renderowania. Automatyczne odtwarzanie w trybie wsadowym otwiera wyrenderowane pliki jako listę odtwarzania. Automatyczne otwieranie folderu nie otwiera ponownie folderu, który soundWave już otworzył w bieżącej sesji NVDA.
Szablony nazw
Pola nazw są szablonami. soundWave zastępuje każdy znacznik informacjami z bieżącego renderowania przed zaproponowaniem folderu lub nazwy pliku.
Możesz usuwać znaczniki, przenosić je, dodawać własne słowa albo zmieniać interpunkcję między nimi.
| Ustawienie | Domyślnie | Przykładowy wynik | Co kontroluje |
| Wzorzec folderu pojedynczego renderowania |
%engine% - %voice% |
Sonata - Kirsten Two En Medium |
Folder proponowany przez okno Zapisz jako dla schowka, wpisanego tekstu albo jednego pliku tekstowego. |
| Wzorzec nazwy pojedynczego pliku |
%source% |
Schowek.wav |
Sugerowana nazwa pliku dla pojedynczego renderowania. |
| Wzorzec folderu wsadowego |
%engine% - %voice% |
Keynote Gold - Fred |
Folder wyjściowy tworzony podczas renderowania folderu plików tekstowych. |
| Wzorzec pliku wsadowego |
%number% - %source% |
03 - rozdział trzeci.wav |
Nazwa każdego wyrenderowanego pliku w trybie wsadowym. |
Przykłady nazw
| Wzorzec | Przykładowy wynik | Kiedy jest przydatny |
%engine% - %voice% |
Orpheus - Synthetic Dave |
Grupuje wyjście według syntezatora i głosu. |
%source% - %engine% |
rozdział pierwszy - SAPI5.wav |
Zostawia nazwę źródła na początku, ale nadal pokazuje syntezator. |
%number% - %source% |
01 - napisy początkowe.wav |
Utrzymuje przewidywalną kolejność plików wsadowych. |
Znaczenie znaczników nazw plików
| Znacznik | Znaczenie | Przykładowa wartość |
%source% |
Schowek, wpisany tekst, nazwa pliku źródłowego albo nazwa elementu z folderu źródłowego. |
Schowek, Wpisany tekst, rozdział pierwszy albo notatki ze spotkania |
%engine% |
Nazwa syntezatora. |
Orpheus, Sonata, SAPI5 albo Pocket TTS |
%voice% |
Wybrany głos, jeśli soundWave potrafi go rozpoznać. Jeśli głos nie jest znany, ta część jest usuwana w czysty sposób. |
Synthetic Dave, Kirsten Two En Medium albo Fred |
%number% |
Numer porządkowy. Renderowanie folderu dodaje go automatycznie; znacznik jest dostępny także dla własnych wzorców nazw. |
01, 02 albo 03 |
Opcje syntezatorów
Syntezatory udostępniają takie ustawienia jak głos, język, wariant, szybkość, tempo, wysokość albo głośność tam, gdzie dana opcja jest obsługiwana.
Większość okien ustawień zawiera:
- Automatycznie odtwarzaj przy zmianie ustawień, aby automatycznie odsłuchiwać zmiany.
- Test, aby odtworzyć krótki przykład z bieżącymi ustawieniami.
- Ustawienia trwałe zapisywane w konfiguracji NVDA.
Obsługiwane syntezatory
| Syntezator | Uwagi |
| SAPI5 |
Używa zainstalowanych głosów Microsoft SAPI5. Głosy SAPI5 32-bit są obsługiwane osobną ścieżką pomocniczą 32-bit, jeśli jest dostępna. W oknie renderowania można regulować tempo, wysokość i głośność SAPI5. soundWave pyta SAPI o domyślny format wyjściowy wybranego głosu zamiast wymuszać stałą częstotliwość próbkowania; jeśli SAPI nie udostępnia formatu, używany jest zapasowy format 22,05 kHz 16-bit mono. |
| googleTtsForNvda |
Wymaga dodatku Google TTS For NVDA oraz zainstalowanych pakietów głosów Google. Podczas renderowania soundWave bezpośrednio przechwytuje audio PCM generowane przez dodatek. Przycisk Test renderuje krótką próbkę do tymczasowego pliku WAV i ją odtwarza, omijając ścieżkę bieżącej mowy NVDA. soundWave pokazuje tylko głosy Google zainstalowane i stabilne w tej ścieżce renderowania offline, więc lista może być krótsza niż pełny katalog głosów dodatku Google. |
| Pocket TTS |
Wymaga dodatku Pocket TTS. soundWave renderuje w mniejszych segmentach, gdy jest to potrzebne, aby dłuższy tekst rzadziej trafiał na ograniczenia modelu. Okno opcji zawiera czułość końca zdania Pocket TTS, jeśli zainstalowany syntezator ją udostępnia. |
| Supertonic |
Wymaga dodatku Supertonic. soundWave używa mniejszych fragmentów renderowania dla Supertonic, aby dłuższe wejście mogło zostać wyrenderowane bez przekroczenia limitu rozmiaru wejścia modelu. |
| Sonata |
Wymaga dodatku Sonata Neural Voices oraz dostępnych plików konfiguracji głosów. |
| Eloquence i IBMTTS |
Dostępne, gdy zainstalowany jest odpowiedni dodatek NVDA. soundWave automatycznie wykrywa silnik mowy i udostępnia opcje głosu oraz szybkości przed renderowaniem. |
| Orpheus |
Wymaga ustawienia Orpheus jako bieżącego syntezatora NVDA przed rozpoczęciem renderowania. Przed renderowaniem można regulować język, głos, szybkość, wysokość i głośność. Podczas renderowania soundWave tymczasowo przełącza NVDA na dostępny syntezator zapasowy. |
| Orpheus Classic |
Dostępny, gdy zainstalowany jest dodatek Orpheus Classic. soundWave używa dedykowanej ścieżki przechwytywania dla tego starszego syntezatora, dzięki czemu dłuższe pauzy i znaki interpunkcyjne nie powodują ucinania wyjścia. |
| DECtalk i Keynote Gold |
Dostępne, gdy wymagany dodatek jest zainstalowany i możliwy do wykrycia. Keynote Gold udostępnia w oknie renderowania głos, szybkość, wysokość, głośność i przyspieszenie tempa. |
| Inne syntezatory NVDA |
soundWave może renderować wiele innych zainstalowanych syntezatorów NVDA, jeśli używają normalnej ścieżki wyjścia audio NVDA. Ogólne okno opcji stosuje głos, wariant, tempo, wysokość i głośność tam, gdzie wybrany syntezator udostępnia te ustawienia. |
Podsumowanie renderowania
Po renderowaniu soundWave zgłasza syntezator, ścieżkę zapisu, czas działania, długość audio i współczynnik szybkości względem czasu rzeczywistego, jeśli jest dostępny.
Aktualizacje
soundWave używa kanału aktualizacji dodatków NVDA zgodnego z dystrybucją przez Add-on Store.
Zmiany
1.1.2
- Dodano dedykowaną ścieżkę przechwytywania Orpheus Classic. soundWave renderuje teraz Orpheus Classic przez normalny przepływ sterownika NVDA, jednocześnie bezpośrednio przechwytując wygenerowane audio, co zapobiega bardzo krótkiemu wyjściu, które mogło wystąpić przez ogólne przechwytywanie NVDA.
- Ulepszono renderowanie Orpheus Classic wokół dłuższych pauz interpunkcyjnych, w tym linii z wykrzyknikami i dłuższych pauz we wpisach podobnych do Mastodona.
1.1.1
- Ulepszono długie rendery googleTtsForNvda przez ponowne użycie jednej instancji mostu Google dla całego renderowania, mniejsze fragmenty specyficzne dla Google i ponawianie po odzyskiwalnych błędach mostu Chrome DevTools.
- Zmieniono okno postępu tak, aby można je było zminimalizować skrótem Alt+M. Ponowne użycie polecenia soundWave przywraca aktywny postęp zamiast otwierać drugie okno renderowania.
- Ulepszono raportowanie czasu działania i długości audio, aby długie rendery były pokazywane w minutach albo godzinach, a nie tylko w sekundach.
- Przywracanie ustawień głosu, wariantu, języka, tempa, wysokości i głośności po ogólnym przechwytywaniu NVDA zmniejsza ryzyko przeniesienia ustawień do bieżącej mowy NVDA.
- Zamknięto #5.
1.1.0
- Znacznie ulepszono obsługę googleTtsForNvda. SoundWave renderuje przez most Google bardziej niezawodnie, pokazuje tylko zainstalowane głosy działające przez ścieżkę renderowania offline, ponawia próbę, jeśli strona mostu nie jest gotowa, i nie przełącza po cichu na inny głos.
- Ulepszono podglądy googleTtsForNvda przez renderowanie frazy testowej do tymczasowego pliku WAV przed odtworzeniem, dzięki czemu automatyczny podgląd może pozostać włączony bez używania bieżącej mowy NVDA.
- Ulepszono tekst postępu renderowania googleTtsForNvda podczas oczekiwania na audio od Google.
- Ulepszono renderowanie Pocket TTS przez pomijanie pustych wierszy i dzielenie tekstu na bezpieczniejsze segmenty dla modelu.
- Dodano czułość końca zdania Pocket TTS do okna opcji syntezatora, jeśli jest dostępna.
- Dodano dzielenie tekstu specyficzne dla Supertonic, aby dłuższe wejście mogło renderować się bez przekroczenia limitu rozmiaru wejścia modelu.
- Dodano wyjście FLAC i M4A, gdy ffmpeg jest zainstalowany i dostępny w systemowej zmiennej PATH.
- Zmieniono wybór formatu wyjściowego tak, aby pojedyncze i wsadowe rendery pamiętały ostatnio wybrany format.
- Dodano opcjonalne ustawienia pozwalające używać domyślnego formatu wyjściowego bez pokazywania okna Zapisz jako dla pojedynczego renderowania albo wyboru formatu wsadowego.
- Zmieniono automatyczne odtwarzanie w trybie wsadowym tak, aby ukończone rendery folderu otwierały się jako lista odtwarzania, a nie odtwarzały tylko pierwszy plik.
- Zmieniono automatyczne otwieranie folderu wyjściowego tak, aby soundWave nie otwierał wielokrotnie tego samego folderu w jednej sesji NVDA.
- Dodano panel ustawień soundWave w ustawieniach NVDA dla domyślnego folderu zapisu, szablonów nazw i akcji po renderowaniu.
- Dodano akcje po renderowaniu: otwarcie folderu wyjściowego, odtworzenie ukończonego pliku audio i sterowanie wyświetlaniem podsumowania renderowania.
- Dodano przycisk Otwórz folder do podsumowania renderowania.
- Dodano wejście folderu do renderowania wsadowego.
- Ulepszono nazewnictwo wyjścia przez osobne szablony dla folderów pojedynczego renderowania, pojedynczych plików, folderów wsadowych i plików wsadowych.
- Ulepszono sugerowane nazwy plików wyjściowych tak, aby wybrane nazwy głosów były uwzględniane w większej liczbie ścieżek renderowania.
- Podzielono specjalistyczną obsługę syntezatorów na osobne moduły dla SAPI5, DECtalk, BestSpeech, Sonata, Pocket TTS, googleTtsForNvda, Eloquence/IBMTTS, Orpheus i ogólnych ścieżek przechwytywania NVDA.
- Dodano automatyczne wykrywanie Eloquence i IBMTTS, aby renderowały przez dedykowaną ścieżkę silnika zamiast przez ogólne przechwytywanie NVDA.
1.0.4
- Dodano obsługę renderowania googleTtsForNvda na podstawie PR #3 autorstwa Ruslana Dolovaniuka.
1.0.3
- Dodano obsługę wysokości SAPI5 przy użyciu natywnego znacznika XML pitch w SAPI.
- Zmieniono renderowanie WAV SAPI5 tak, aby używało domyślnego formatu wyjściowego wybranego głosu SAPI, jeśli jest dostępny, zamiast zawsze wymuszać 22,05 kHz 16-bit mono.
1.0.2
- Dodano kontrolki wysokości i głośności dla Orpheus, Keynote Gold i ogólnego renderowania syntezatorów NVDA.
- Dodano obsługę głośności dla renderowania SAPI5.
- Ulepszono klawiaturową regulację opcji liczbowych. Page Up i Page Down wykonują większe zmiany, a Home i End przechodzą do wartości minimalnej i maksymalnej.
- Zmieniono szczegóły renderowania na listę wiersz po wierszu, aby informacje o postępie były łatwiejsze do przeglądania za pomocą czytnika ekranu.
- Zapamiętywanie tego, czy szczegóły renderowania są pokazane czy ukryte, między renderowaniami.
- Dodano nazwy wybranych głosów do sugerowanych nazw plików wyjściowych, gdy SoundWave potrafi rozpoznać głos.
- Dodano dostęp do instrukcji klawiszem F1 w oknach renderowania soundWave oraz przyciski Pomoc dostępne klawiszem Tab.
- Ulepszono skróty klawiaturowe w oknach dialogowych, w tym przyciski Test i kontrolki opcji syntezatora.
1.0.1
- Dostosowano obsługę aktualizacji do dystrybucji przez NVDA Add-on Store.
1.0.0
Rozwiązywanie problemów
- Nie powstaje audio: wybrany syntezator może nie udostępniać ścieżki audio, którą soundWave potrafi renderować. Spróbuj innego syntezatora i sprawdź log NVDA.
- Eloquence lub IBMTTS nie jest dostępny: zainstaluj lub zaktualizuj odpowiedni dodatek NVDA, przeładuj NVDA i spróbuj ponownie.
- Orpheus się nie uruchamia: przełącz bieżący syntezator NVDA na Orpheus, a następnie ponownie otwórz soundWave.
- WorldVoice się nie inicjuje: sprawdź log NVDA pod kątem brakujących plików w WorldVoice-workspace. soundWave nie może renderować WorldVoice, dopóki sam WorldVoice nie załaduje się poprawnie.
- Eksport MP3, FLAC lub M4A nie działa: zainstaluj ffmpeg i upewnij się, że polecenie ffmpeg działa z wiersza polecenia.
- Renderowanie wygląda na zawieszone: użyj Anuluj. Jeśli problem się powtarza, dołącz do zgłoszenia nazwę syntezatora, ustawienia, typ wejścia i odpowiednie wpisy z logu NVDA.