Necessidade de dispositivo que:
Soluções cloud (Alexa, Google) exigem:
Implementei assistente de voz offline com:
~200ms latency
"ligar luz", "desligar ventilador", etc.
Ativa escuta somente após "Alexa" (ou palavra customizada)
Rodam em RAM limitada do ESP32
LED + buzzer confirmam comando reconhecido
Funciona sem internet
ESP32 + Microfone digital (I2S)
16-bit, 16kHz, Mono
Espressif ESP-SR (Speech Recognition library)
MultiNet (10 comandos) + WakeNet (wake word)
Q8 (8-bit) para compactação
ESP-IDF com Audio Front-End (AFE)
Modelos armazenados em SPIFFS (~2MB)
Noise cancellation, MFCC, Neural network (~100KB)
Desafio: Modelo treinado em ambiente silencioso falhava em ambientes reais (ventilador ligado, barulho de rua). Acurácia caía de 95% para 40%.
Solução Implementada:
Resultado: Acurácia em ambiente ruidoso: 88% (aceitável). Trade-off: alguns falsos negativos, mas zero falsos positivos prejudiciais.
Desafio: Tempo de "Alexa... [espera processamento]... comando executado" era 800ms. Esperado: <200ms.
Solução Implementada:
Resultado: Latência reduzida para 150ms (quase imperceptível). E2E: "Alexa" → comando executado em 200ms.
Desafio: Modelo neural completo (não quantizado) ocuparia 5MB. ESP32 tem apenas 520KB SRAM. Modelo não cabe.
Solução Implementada:
Resultado: Modelo completo ocupa 300KB RAM. Deixa 200KB livre para buffers de audio e stack.
Desafio: Se usuário diz "Alexa, liga a TV", o modelo confundia "Alexa" com "TV" às vezes. Acurácia: 78%.
Solução Implementada:
Resultado: Acurácia 96% agora. Wake word detection praticamente perfeito. Redução de false activations de 8% para <1%.
Zero latência de rede, zero custos de API
Acurácia (depende do comando e ambiente)
Consumo médio (poderia rodar em bateria)
Latência end-to-end
📊 Assistente de voz funcional 100% offline: Zero latência de rede, zero custos de API
📊 Privacidade total: Audio nunca deixa o dispositivo (apenas comando binário)
📊 Acurácia 88-96%: Depende do comando e ambiente
📊 Energy efficient: <100mW médio (poderia rodar em bateria)
📊 10 comandos customizáveis: Rápido adaptar para novos contextos
📊 Expertise consolidada: Machine Learning no edge, Espressif ESP-SR, quantização de modelos, otimização de latência