Przejdź do głównej zawartości

Transkrypcja spotkań

Moduł transkrypcji spotkań pozwala rejestrować przebieg rozmów i generować z nich transkrypcję ze znacznikami czasu. Speedwave przechwytuje dźwięk bezpośrednio na Twojej maszynie (w systemie hosta aplikacji Desktop) i przetwarza go lokalnie za pomocą silnika whisper.cpp, dzięki czemu nagranie audio nigdy nie opuszcza Twojego komputera. Kontener, w którym uruchomiony jest Claude, nie ma bezpośredniego dostępu do urządzeń audio.

Przy każdym nagraniu możesz wybrać jedno z trzech źródeł dźwięku: całe spotkanie (dźwięk systemowy oraz mikrofon, przetwarzane w osobnych kanałach), wyłącznie dźwięk systemowy lub wyłącznie mikrofon. Moduł Silero VAD automatycznie odcina fragmenty ciszy, co zapobiega halucynacjom modelu Whisper w momentach braku mowy. Wygenerowany zapis zawiera znaczniki czasu, nie rozróżnia jednak automatycznie osób mówiących: przypisanie wypowiedzi do poszczególnych uczestników można zlecić Claude w oknie czatu.

  1. Przejdź do Ustawienia -> Funkcje beta i włącz opcje beta, aby odsłonić zakładkę Transkrypcja spotkań.
  2. W sekcji Ustawienia -> Transkrypcja spotkań pobierz model mowy: Whisper large-v3 lub large-v3-turbo, dobrany do parametrów Twojego komputera. Pliki modelu zajmują od 1,5 do 2,9 GiB i są weryfikowane sumą kontrolną SHA-256. Połączenie z siecią jest wymagane wyłącznie jednorazowo podczas pobierania modelu - późniejsza transkrypcja działa całkowicie w trybie offline. Całkowity limit pobierania wynosi 12 GiB, a przekierowania są dozwolone jedynie do zaufanych serwisów (Hugging Face, GitHub i ich sieci CDN).
  3. W zakładce Transkrypcja spotkań wybierz język (polski lub angielski - funkcja nie korzysta z autodetekcji) i kliknij Start, aby rozpocząć rejestrację.

Transkrypcja przebiega dwuetapowo. W trakcie nagrywania na bieżąco generowany jest podgląd na żywo z automatycznym przewijaniem. Po zatrzymaniu nagrania (przycisk Stop) uruchamia się dokładniejsze przetwarzanie offline, które analizuje całe nagranie od początku i zastępuje tekst roboczy wersją finalną. Zakończone nagranie można również w dowolnym momencie wznowić. Panel sterowania informuje o wykorzystywanej akceleracji sprzętowej: Metal (GPU) w systemie macOS lub CPU na pozostałych platformach. W razie niepowodzenia etapu offline (np. przy uszkodzonym lub pustym pliku audio) sesja otrzymuje status failed: <powód>, a w oknie pozostaje dostępny tekst z etapu na żywo.

Transkrypcja pozostaje na Twoim urządzeniu do momentu, gdy sam zdecydujesz o jej przekazaniu. Kliknięcie przycisku „Wyślij do Claude” wyświetla prośbę o potwierdzenie, po czym przesyła treść tekstową do aktywnego dostawcy LLM (np. w celu przygotowania podsumowania lub wyodrębnienia listy zadań). Do dostawcy trafia wyłącznie tekst - plik audio nigdy nie jest wysyłany przez sieć.

Każde nagranie jest zapisywane w katalogu ~/.speedwave/transcripts/<id>/ w postaci pary plików: audio.wav oraz transcript.json. Dostęp do plików ma wyłącznie właściciel konta; dane nie są szyfrowane na dysku (data at rest) i nie podlegają automatycznemu czyszczeniu. W przypadku długich nagrań bufor audio w pamięci przyrasta w tempie około 115 MB na godzinę (mono 16 kHz), a Speedwave odnotowuje ostrzeżenie diagnostyczne w logach co 30 minut.

Funkcja transkrypcji wymaga systemu macOS 14.4 lub nowszego. W systemie Windows dźwięk systemowy jest przechwytywany za pośrednictwem API WASAPI. W systemie macOS pierwsze nagranie wywołuje systemową prośbę o uprawnienia do mikrofonu, które w razie potrzeby można zresetować poleceniem tccutil reset Microphone pl.speedwave.desktop.audio-capture.

Więcej informacji o przetwarzaniu danych znajdziesz w rozdziale Dane i prywatność.