V VComInt Seu fornecedor de informações em SEO
Agora em End-to-end Streaming Keyword Spotting – US20260088023A1
← Diretório de patentes

patentes

Patente · Aplicada · USPTO

End-to-end Streaming Keyword Spotting – US20260088023A1

Método para treinar detecção de hotword em streaming que utiliza uma rede neural memorizada com arquitetura encoder-decoder. Tanto o encoder quanto o decoder são compostos por camadas sequenciais de filtros SVDF (Single Value Decomposition Filter). O método inclui suavização de logits, cálculo de max pooling loss a partir da distribuição de probabilidade e otimização conjunta do encoder e do decoder com base nas perdas acumuladas da sequência de áudio de treinamento. O sistema tem como objetivo ativar processos de wake-up em dispositivos a partir do reconhecimento de palavras-chave em tempo real.

Da submissão à aprovação

Submissão 05/12/2025
Aprovação 26/03/2026

Resumo técnico

Método para treinar detecção de hotword em streaming que utiliza uma rede neural memorizada com arquitetura encoder-decoder. Tanto o encoder quanto o decoder são compostos por camadas sequenciais de filtros SVDF (Single Value Decomposition Filter). O método inclui suavização de logits, cálculo de max pooling loss a partir da distribuição de probabilidade e otimização conjunta do encoder e do decoder com base nas perdas acumuladas da sequência de áudio de treinamento. O sistema tem como objetivo ativar processos de wake-up em dispositivos a partir do reconhecimento de palavras-chave em tempo real.

Resumo Técnico

A patente descreve um método ponta a ponta para detecção de palavras-chave (hotwords) em fluxo de áudio contínuo, sem depender de sistemas intermediários de reconhecimento de fala.

Arquitetura

O modelo utiliza uma rede neural memorizada com estrutura encoder-decoder. Cada componente é formado por camadas SVDF empilhadas sequencialmente. Essa arquitetura foi projetada para operar com baixa latência e em dispositivos com recursos computacionais limitados, como assistentes de voz embarcados.

Processo de treinamento

O treinamento recebe sequências de áudio contendo a hotword a ser detectada. Para cada sequência:

  • O encoder e o decoder geram logits independentes
  • Os logits passam por suavização antes do cálculo da perda
  • A max pooling loss é calculada a partir da distribuição de probabilidade de cada componente
  • O encoder e o decoder são otimizados conjuntamente com base em todas as perdas associadas à sequência

Dados da publicação

  • Número da publicação: US20260088023A1
  • Número da aplicação: US19/409,906
  • Data de prioridade (prior art): 2018-07-13
  • Data de depósito: 2025-12-05
  • Data de publicação: 2026-03-26
  • Status: Pendente