patentes
Patente · Aplicada · USPTO
End-to-end Streaming Keyword Spotting – US20260088023A1
Método para treinar detecção de hotword em streaming que utiliza uma rede neural memorizada com arquitetura encoder-decoder. Tanto o encoder quanto o decoder são compostos por camadas sequenciais de filtros SVDF (Single Value Decomposition Filter). O método inclui suavização de logits, cálculo de max pooling loss a partir da distribuição de probabilidade e otimização conjunta do encoder e do decoder com base nas perdas acumuladas da sequência de áudio de treinamento. O sistema tem como objetivo ativar processos de wake-up em dispositivos a partir do reconhecimento de palavras-chave em tempo real.
linha temporal
Da submissão à aprovação
resumo
Resumo técnico
Método para treinar detecção de hotword em streaming que utiliza uma rede neural memorizada com arquitetura encoder-decoder. Tanto o encoder quanto o decoder são compostos por camadas sequenciais de filtros SVDF (Single Value Decomposition Filter). O método inclui suavização de logits, cálculo de max pooling loss a partir da distribuição de probabilidade e otimização conjunta do encoder e do decoder com base nas perdas acumuladas da sequência de áudio de treinamento. O sistema tem como objetivo ativar processos de wake-up em dispositivos a partir do reconhecimento de palavras-chave em tempo real.
explicação
Resumo Técnico
A patente descreve um método ponta a ponta para detecção de palavras-chave (hotwords) em fluxo de áudio contínuo, sem depender de sistemas intermediários de reconhecimento de fala.
Arquitetura
O modelo utiliza uma rede neural memorizada com estrutura encoder-decoder. Cada componente é formado por camadas SVDF empilhadas sequencialmente. Essa arquitetura foi projetada para operar com baixa latência e em dispositivos com recursos computacionais limitados, como assistentes de voz embarcados.
Processo de treinamento
O treinamento recebe sequências de áudio contendo a hotword a ser detectada. Para cada sequência:
- O encoder e o decoder geram logits independentes
- Os logits passam por suavização antes do cálculo da perda
- A max pooling loss é calculada a partir da distribuição de probabilidade de cada componente
- O encoder e o decoder são otimizados conjuntamente com base em todas as perdas associadas à sequência
Dados da publicação
- Número da publicação: US20260088023A1
- Número da aplicação: US19/409,906
- Data de prioridade (prior art): 2018-07-13
- Data de depósito: 2025-12-05
- Data de publicação: 2026-03-26
- Status: Pendente