Productivity Tools
Audio & Speech (TTS / STT)
Tingkatkan produktivitas kerja dengan fitur voice dictation (STT), continuous dictation, post-hoc keystroke learning, Read Aloud (TTS), dan kamus personal Snipset.
Rangkaian fitur Audio & Speech di Snipset mengintegrasikan teknologi Speech-to-Text (STT) untuk voice dictation dan Text-to-Speech (TTS) untuk Read Aloud langsung ke dalam alur kerja desktop Anda. Dibangun dengan fokus privasi local-first, fitur ini dapat digunakan di seluruh aplikasi Windows, text field, code editor, maupun browser dengan latensi minimal.
Kemampuan Utama
- Multi-Mode Speech-to-Text (STT): Dikte teks langsung di posisi kursor aktif, terjemahkan ucapan suara secara real-time, atau ajukan perintah suara langsung ke model AI (Ask Anything).
- Continuous Dictation & Ketahanan Jeda (Pause-Resilience): Bicara dengan tempo alami tanpa risiko kehilangan transkripsi saat berhenti sejenak untuk berpikir atau saat fokus jendela berpindah.
- Post-Hoc Keystroke Learning & Edit Rate: Melacak koreksi keyboard manual setelah sesi dikte untuk menghitung edit distance dan otomatis menyarankan kosakata baru ke kamus personal.
- Global Read Aloud (TTS): Sorot teks apa pun di aplikasi Windows mana saja dan tekan hotkey (
Alt+I) untuk mendengarkan pembacaan teks dengan suara alami. - Umpan Balik TTS untuk Respons AI: Dengarkan jawaban AI secara langsung di dalam floating overlay card dengan kontrol pemutaran audio lengkap.
- Optimasi Audio Hardware: Automatic Gain Control (AGC), Noise Suppression, Acoustic Echo Cancellation (AEC), dan penyesuaian silence threshold.
- Local Whisper & Mode Offline: Transkripsikan audio secara lokal menggunakan model Whisper ONNX tanpa pengiriman data ke server luar.
- Kamus Suara Personal (Custom Dictionary): Tambahkan akronim khusus, simbol kode, dan istilah teknis agar tidak salah ditranskripsi.
- Voice Profiles & Suara Kustom: Pilih antara mesin bawaan SAPI5, suara neural Edge, mesin lokal Sherpa-ONNX, atau cloned voice profiles.
- Perlindungan Privasi & Kebijakan Retensi: Atur masa hapus otomatis untuk rekaman audio dan bersihkan seluruh riwayat audio dengan satu klik.
- Analitik Produktivitas & Ucapan: Pantau jumlah kata yang didiktekan, volume karakter yang dibacakan, metrik edit rate, dan waktu yang dihemat di dasbor Statistik.
Memulai
Akses pengaturan Audio & Speech melalui Sistem → Pengaturan → Audio & Dikte di bilah sisi (sidebar) Snipset:
+-------------------------------------------------------------+
| 🎙️ Mikrofon Aktif: [ HyperX QuadCast S (Default) ] |
| ⚡ Preset Audio: [ ● Close-field USB Mic ○ Laptop Mic ] |
| 🔊 Filter Hardware: [✔] AGC [✔] Noise Suppression [✔] AEC|
+-------------------------------------------------------------+
| 📝 Hotkey Dikte: [ Alt+. ] |
| 🗣️ Hotkey Read Aloud: [ Alt+I ] |
| 🌐 Bahasa Utama: [ Indonesian (Indonesia) ▼ ] |
+-------------------------------------------------------------+
| 🤖 Model Whisper: [ Whisper Base (Local ONNX) ▼ ] |
| 🔊 Mesin TTS: [ Microsoft Natural Edge (Auto) ▼ ] |
+-------------------------------------------------------------+
Mode Speech-to-Text (STT) & Dikte
Snipset menyediakan tiga mode voice input yang dapat dipetakan ke trigger pintasan pilihan Anda:
1. Dikte Langsung (dictate)
Gunakan mode Push-to-Talk (tahan tombol) atau Toggle (tekan sekali) pada pintasan dikte, ucapkan kalimat Anda secara alami, lalu lepas tombol. Snipset akan mentranskripsikan suara secara real-time dan mengetikkan hasilnya langsung di posisi kursor aktif.
- Akumulasi Teks Kontinu: Jeda hening saat Anda berpikir tidak akan menutup rekaman secara prematur. Transkripsi teks akan terus terakumulasi dengan aman melintasi beberapa segmen ucapan.
- Tanda Baca & Huruf Kapital: Mengenali tanda baca secara otomatis ("koma", "titik", "baris baru").
- Injeksi Kursor Native: Menggunakan sintesis input Windows tingkat rendah untuk mengetik langsung ke IDE, terminal/CMD, aplikasi chat, hingga formulir browser.
2. Terjemahan Suara Langsung / Live Voice Translation (translate)
Bicaralah dalam bahasa ibu Anda (misalnya Bahasa Indonesia, Spanyol, Jepang), dan Snipset akan secara otomatis mentranskripsikan serta mengetikkan teks terjemahan dalam bahasa target pilihan Anda (misalnya Bahasa Inggris) secara instan.
3. Voice AI: Ask Anything (ask_anything)
Ucapkan pertanyaan kompleks atau instruksi coding. Snipset akan menangkap suara, mengubahnya menjadi teks terstruktur, meneruskannya ke model Ollama lokal atau asisten Cloud AI aktif, lalu menampilkan respons pada kartu overlay lengkap dengan tombol pengetikan instan dan pemutaran audio Read Aloud.
Post-Hoc Keystroke Learning & Evaluasi Edit Rate
Snipset dilengkapi mekanisme pembelajaran adaptif di latar belakang berdasarkan koreksi manual yang Anda lakukan setelah mendikte:
- Jendela Koreksi 15 Detik: Setelah sesi dikte berakhir, Snipset memantau ketukan keyboard manual dan backspace pada aplikasi target.
- Evaluasi Edit Rate Real-Time: Menghitung jarak sunting (Levenshtein edit distance) antara teks transkripsi asli dengan hasil akhir yang Anda ketik.
- Saran Kamus Otomatis: Saat Anda mengoreksi istilah teknis yang salah dikenali (misalnya mengubah "cubernetis" menjadi "Kubernetes"), Snipset secara otomatis merekam pasangan kata tersebut dan menampilkan opsi penambahan satu klik ke Custom Speech Dictionary.
Floating Speech Overlay HUD
Saat merekam, jendela floating HUD yang ringkas akan muncul di layar:
- Live VU Meter & Waveform: Visualisasi level input mikrofon secara real-time.
- Indikator Status: Umpan balik visual untuk status Listening, Transcribing, Synthesizing, dan Editing.
- Kartu Respons AI dengan TTS: Pada mode Ask Anything, tinjau kartu respons AI dengan tombol Play, Pause, Resume, Stop, dan Copy.
- Audio Feedback Soundpacks: Isyarat audio opsional (soft chimes) saat rekaman dimulai, dihentikan, atau berhasil diproses.
Anda dapat menggeser jendela floating speech overlay HUD ke posisi mana saja di layar. Koordinat posisi tersebut akan tersimpan otomatis.
Text-to-Speech (TTS) & Read Aloud
Mesin Read Aloud memungkinkan Anda mendengarkan dokumen panjang, diff pada pull request, email, atau cuplikan teks tanpa membuat mata lelah.
Menjalankan Read Aloud
- Sorot Teks: Pilih teks di jendela mana pun (VS Code, Chrome, Outlook, Notion).
- Pintasan Global: Tekan
Alt+I(atau hotkey kustom Anda). - Overlay Kontrol: Kendalikan pemutaran (Play, Pause, Resume, Stop) dari HUD atau tombol media keyboard.
Arsitektur Multi-Engine
Snipset menggunakan arsitektur TTS multi-mesin yang fleksibel:
| Mode Mesin | Keterangan | Latensi | Kebutuhan Internet |
|---|---|---|---|
| Auto (Direkomendasikan) | Memakai suara natural cloud saat terhubung internet, dan beralih ke mesin lokal saat offline. | Sangat Rendah | Opsional |
| Local Only (SAPI5 / Sherpa) | Mensintesis suara secara lokal menggunakan Windows SAPI5 atau model offline Kokoro/Sherpa-ONNX. | Instan | 100% Offline |
| Edge Neural / Cloud | Kualitas suara manusia alami berdefinisi tinggi dengan intonasi natural di 70+ bahasa. | Rendah | Diperlukan |
Kustomisasi Suara & Profil
- Kecepatan & Nada: Sesuaikan kecepatan baca dari 0.5x hingga 2.5x menggunakan slider real-time.
- Pilihan Persona Suara: Beralih antara karakter suara pria dan wanita per bahasa.
- Caching Audio Persisten: Potongan audio yang telah disintesis disimpan di disk lokal. Membaca ulang teks yang sama akan langsung diputar tanpa proses ulang.
Kamus Suara Personal (Custom Dictionary)
Istilah teknis khusus, nama library, atau kode (syntax) seperti Kubernetes, PostgreSQL, Axios, OAuth2 terkadang dapat salah dikenali oleh model akustik umum.
Snipset menyediakan fitur Kamus Suara Kustom:
- Buka Sistem → Pengaturan → Audio & Voice → Custom Dictionary.
- Tambahkan Trigger Word (cara pengucapan) dan Replacement Text (teks yang seharusnya diketik).
- Pembelajaran Otomatis: Tinjau saran kosakata yang dipelajari otomatis dari koreksi keystroke Anda dan setujui dengan satu klik.
Preprocessing Audio Hardware
Untuk menjaga akurasi transkripsi di berbagai kondisi ruangan, Snipset menyertakan filter audio DSP (Digital Signal Processing) bawaan:
- Automatic Gain Control (AGC): Menyesuaikan volume input secara dinamis sehingga suara bisikan maupun suara lantang terdengar seimbang.
- Noise Suppression: Menyaring suara dengung pendingin ruangan, ketikan keyboard, kipas komputer, dan kebisingan latar belakang.
- Acoustic Echo Cancellation (AEC): Mencegah suara dari speaker komputer masuk kembali ke mikrofon dan memicu putaran gema.
- Preset Jarak Mikrofon:
- Laptop / Webcam Mic: Profil high-gain yang dioptimalkan untuk jarak 1–2 meter.
- USB / Headset Mic: Profil low-gain jarak dekat untuk suara yang jernih dan fokus.
Privasi, Keamanan & Retensi Data
Snipset dirancang dengan standar kerahasiaan data yang ketat:
- Opsi Zero Cloud Recording: Saat menggunakan model Local Whisper ONNX, data audio tidak pernah keluar dari komputer Anda.
- Kebijakan Retensi: Atur aturan pembersihan file audio otomatis (7 hari, 30 hari, 90 hari, atau Jangan Pernah).
- Penyimpanan Lokal Terenkripsi: Log riwayat suara dan file WAV sementara disimpan di direktori data aplikasi lokal pribadi Anda.
- Pembersihan Sekali Klik: Hapus seluruh rekaman audio yang tersimpan secara instan melalui Pengaturan → Audio → Purge All Recordings.
Referensi Konfigurasi & Pengaturan
| Kunci Konfigurasi | Tipe | Standar | Keterangan |
|---|---|---|---|
dictation_hotkey | String | "Alt+." | Pintasan global untuk memulai/menghentikan dikte Speech-to-Text. |
read_aloud_hotkey | String | "Alt+I" | Pintasan global untuk memicu Text-to-Speech Read Aloud. |
stt_model | String | "whisper-base" | Model pengenalan suara akustik yang aktif. |
primary_language | String | "id-ID" | Bahasa utama yang digunakan saat mendikte. |
translation_target_lang | String | "en" | Bahasa tujuan saat menggunakan Live Voice Translation. |
post_hoc_learning | Boolean | true | Mengaktifkan pembelajaran kosakata otomatis dari koreksi keyboard setelah dikte. |
auto_gain_control | Boolean | true | Mengaktifkan normalisasi volume hardware otomatis. |
noise_suppression | Boolean | true | Mengaktifkan filter peredam kebisingan dan suara kipas. |
tts_engine_mode | String | "auto" | Pemilihan mesin TTS (auto, local_only, browser_only). |
tts_speed | Number | 1.0 | Pengali kecepatan pemutaran suara Read Aloud (0.5 hingga 2.5). |
retention_period | String | "30d" | Batas waktu penyimpanan file audio sebelum dibersihkan otomatis. |