Saltar al contenido
← Volver al observatorio

Nebulosa: Personal · Helix Nebula · NGC 7293

WhisperFlow — dictado por voz offline para Windows

Dictado push-to-talk local, offline y privado para Windows 11 (ES/EN): atajo global, reconocimiento de voz en el dispositivo y texto insertado en la app con foco.

Rol
Autor
Periodo
jul 2026 → actual
Instrumentos
Python 3.12 · ONNX Runtime · Parakeet TDT · faster-whisper · Win32 API (ctypes) · pytest · ruff
Repositorio
rubo6/whisperflow ↗

★ 0 estrellas · ⑂ 0 forks · Python · último push sep 2026

Quería la sensación de las herramientas de dictado en la nube sin enviar un solo byte de mi voz a ningún lado. WhisperFlow es el resultado: mantienes una tecla, hablas, sueltas, y el texto aparece en la app que estabas usando. Todo ocurre en la máquina: captura a 16 kHz, reconocimiento de voz local, un pipeline pequeño de postproceso e inyección vía portapapeles o teclas sintéticas con una vista previa segura como respaldo.

La ingeniería de la que más me orgullezco es la parte aburrida: un threat model escrito, invariantes forzadas por el esquema de configuración (el audio nunca se persiste, el texto dictado nunca se loguea), un runtime de Python congelado para no depender del Python del equipo, verificación de integridad de modelos y binarios, y una suite de pruebas alrededor de la máquina de estados que coordina el hilo del atajo, el callback de audio y el worker por dictado.

Con esta herramienta dicté las respuestas que dieron forma a este sitio.