Versión de investigación independiente para macOS

Tu voz.
Sigue siendo tuya.

Echo es un sistema local para dictado privado e inteligencia de reuniones basada en evidencia. La voz permanece en tu Mac.

Echo · sesión localPrivado
Ver cómo funciona
4,74 %WER generado11 muestras de voz generadas
≈85 mstiempo medio del modeloruta Parakeet de producción
0 / 2falsos positivos sin vozsilencio + ruido de fondo bajo
6,19 %*WER del subconjunto público AA634 muestras públicas publicadas
El objetivo del producto

Una capa de voz privada.
Dos flujos enfocados.

Echo combina dictado rápido entre aplicaciones con inteligencia de reuniones basada en evidencia en una app independiente para Mac, sin convertir la voz privada en una dependencia de la nube.

01
Dictado privado

Habla naturalmente.
El texto aparece rápido.

Parakeet multilingüe se ejecuta mediante Core ML y Echo aplica vocabulario local y reglas de comandos hablados antes de una entrega segura.

  • Ruta de producción: Parakeet TDT 0.6B v3
  • Vocabulario determinista, sin afirmar ajuste de pesos
  • Mantener, pulsar dos veces o alternar para dictar
02
Inteligencia de reuniones

Notas fundamentadas.
Decisiones trazables.

Las transcripciones locales se convierten en hechos candidatos, se validan contra la evidencia y se reducen a notas estructuradas mediante un modelo Qwen local.

  • Mapear → validar evidencia → reducir
  • Cinco dominios 5/5 y llamada financiera corregida 9/9
  • Whisper large-v3-turbo como prueba y alternativa
Arquitectura de dictado en producción

Diseñado como sistema,
no solo como modelo.

La calidad del reconocimiento importa. También la fiabilidad de captura, la corrección privada, la seguridad de la app activa, la latencia y la evidencia registrada después de cada prueba.

01

Capturar

Audio con tecla de función, permisos, VAD y silencio

02

Reconocer

Parakeet TDT 0.6B v3 convertido para Core ML

03

Resolver

Vocabulario privado y comandos hablados deterministas

04

Entregar

Insertar o copiar con controles de foco y autorización

Producción

Parakeet TDT 0.6B v3

Multilingüe, rápido, local y desplegado mediante Core ML para la ruta actual de dictado.

Alternativa rechazada

Qwen3-ASR 0.6B INT8

13,19 % de WER generado, ≈2,94 s de media y una debilidad grave con vocabulario técnico. No sustituyó a Parakeet.

Alternativa para reuniones

Whisper large-v3-turbo

Se conserva como prueba y alternativa para transcripción de reuniones, no como ruta de dictado de producción.

Medido, publicado y delimitado

Pruebas con
sus notas incluidas.

Las comparaciones directas de Echo comparten audio y puntuación. Los resultados publicados de modelos y servicios en la nube se mantienen como contexto. Ningún número cruza protocolos sin etiqueta.

Descargar el paquete de evidencia ↓
Echo benchmark highlights showing WER, speed, and API fee contextAbrir en resolución completa ↗
Common WER: Identical 100-clip public-audio track
Common WERIdentical 100-clip public-audio track
Difficulty: Clean and harder public-audio slices
DifficultyClean and harder public-audio slices
Processing time: Model-only and whole-run timing
Processing timeModel-only and whole-run timing
Short-form context: Published upstream model results
Short-form contextPublished upstream model results
Long-form context: Published meeting-transcription results
Long-form contextPublished meeting-transcription results
AA-WER context: Echo’s measured public-subset reconstruction
AA-WER contextEcho’s measured public-subset reconstruction
Meeting intelligence: Grounded-output contract results
Meeting intelligenceGrounded-output contract results
Evidence status: Measured and implemented boundaries
Evidence statusMeasured and implemented boundaries
* Sobre el resultado del 6,19 %

Echo ejecutó las 634 muestras públicas publicadas de AA-WER v2: 3,25 % en VoxPopuli-Cleaned-AA y 9,13 % en Earnings22-Cleaned-AA. La mitad privada AgentTalk y el normalizador completo actual de Artificial Analysis no están disponibles; por eso es una reconstrucción del subconjunto público, no una puntuación ni clasificación AA-WER oficial.

Documentación

Usar Echo,
desde la captura hasta la evidencia.

01

Primeros pasos

Echo es actualmente una versión de investigación independiente para macOS. Abre la app y concede permisos de Micrófono, Accesibilidad, Monitorización de entrada y Grabación de pantalla solo cuando el flujo correspondiente los requiera.

Límite de la versión actualLa inserción en la app activa funciona y usa una copia segura al portapapeles cuando la inserción directa no está disponible. La distribución pública todavía requiere sus etapas de empaquetado y notarización.
02

Usar el dictado

  1. Elige un modo de captura. Mantén el atajo, púlsalo dos veces o usa el modo alternar.
  2. Habla en la app de destino. Echo graba localmente y registra el destino de forma segura.
  3. Suelta o detén. Parakeet transcribe mediante la ruta local de Core ML.
  4. Revisa la entrega. Echo inserta si el destino es seguro; si no, conserva el texto en el portapapeles.

Echo nunca debe enviar automáticamente un mensaje externo. El reconocimiento, la reescritura y la entrega son etapas separadas.

03

Usar reuniones

  1. Inicia o importa una grabación. El audio se procesa localmente y se minimiza su retención.
  2. Transcribe. Parakeet genera la transcripción local; Whisper sigue como prueba y alternativa.
  3. Mapea los hechos. Un modelo Qwen local propone decisiones, acciones, responsables y preguntas abiertas.
  4. Valida la evidencia. Las afirmaciones no respaldadas se rechazan antes de la reducción final.
≈3–4 sprocesamiento en caliente5/5 · 9/9contratos medidosMap → Validate → ReduceInteligencia de reuniones
04

Vocabulario y comandos hablados

El vocabulario privado es una asignación determinista de hablado → escrito aplicada después del reconocimiento. Puede conservar nombres de productos, personas, herramientas, rutas de archivos y mayúsculas preferidas sin reentrenar ni modificar los pesos del modelo.

habladocore M LescritoCore ML

Los comandos como «nuevo párrafo», «coma» y las indicaciones de corrección se procesan localmente y se registran como etapas del proceso en la evidencia de las pruebas.

05

Modelo de privacidad

Inferencia localEl dictado y la inteligencia de reuniones se ejecutan en el Mac.
Sin dependencia de APILa ruta de producción no envía la voz a un proveedor de transcripción.
Corrección privadaEl vocabulario y los comandos se mantienen deterministas y locales.
Consciente de la evidenciaLas afirmaciones conservan límites de protocolo, modelo, tiempo y alcance.
06

Qué está probado y qué no

Criterio de evidenciaEstadoLímite
ASR generado + sin vozAprobado4,74 % · 0/2 falsos positivos
Ruta de dictado Core MLImplementadoParakeet TDT 0.6B v3
Latencia solo del modeloMedido≈85 ms de media
Vocabulario + comandos deterministasImplementadoProcesamiento local basado en reglas
Pista común de 100 clipsMedidoAudio público muestreado
Subconjunto público AA-WERMedido6,19 % · AA-WER no oficial
Inteligencia de reunionesAprobado5/5 y 9/9 corregido
Ruta de producción localImplementadoSin dependencia de API de transcripción
Inserción en la app activaImplementadoInserta en la app actual, con copia segura cuando la inserción directa no está disponible

Medido hoy: un proceso de voz local rápido, privado y respaldado por evidencia. La inserción en la app activa coloca la transcripción en la app actual, con copia segura cuando la inserción directa no está disponible.

Local por diseño

El futuro de la voz puede sentirse instantáneo
sin sentirse invasivo.

Echo explora, con evidencia, lo que puede llegar a ser un software de voz privado, útil y local.

Acceso al código

Obtén el enlace del repositorio de Echo.

Introduce tu nombre, correo y usuario de GitHub. Después de guardar la solicitud de forma privada, el enlace de GitHub aparecerá aquí.

Guardado de forma privada como solicitud de acceso al código. Tus datos no se muestran públicamente.