Nebulosa: Personal · Helix Nebula · NGC 7293
WhisperFlow — dictado por voz offline para Windows
Dictado push-to-talk local, offline y privado para Windows 11 (ES/EN): atajo global, reconocimiento de voz en el dispositivo y texto insertado en la app con foco.
- Rol
- Autor
- Periodo
- jul 2026 → actual
- Instrumentos
- Python 3.12 · ONNX Runtime · Parakeet TDT · faster-whisper · Win32 API (ctypes) · pytest · ruff
- Repositorio
- rubo6/whisperflow ↗
★ 0 estrellas · ⑂ 0 forks · Python · último push sep 2026
Quería la sensación de las herramientas de dictado en la nube sin enviar un solo byte de mi voz a ningún lado. WhisperFlow es el resultado: mantienes una tecla, hablas, sueltas, y el texto aparece en la app que estabas usando. Todo ocurre en la máquina: captura a 16 kHz, reconocimiento de voz local, un pipeline pequeño de postproceso e inyección vía portapapeles o teclas sintéticas con una vista previa segura como respaldo.
La ingeniería de la que más me orgullezco es la parte aburrida: un threat model escrito, invariantes forzadas por el esquema de configuración (el audio nunca se persiste, el texto dictado nunca se loguea), un runtime de Python congelado para no depender del Python del equipo, verificación de integridad de modelos y binarios, y una suite de pruebas alrededor de la máquina de estados que coordina el hilo del atajo, el callback de audio y el worker por dictado.
Con esta herramienta dicté las respuestas que dieron forma a este sitio.