Interação Multimodal com IA
Com base em terminais de IA físicos, integre visão de borda, voz e APIs de sistemas de negócios para implementar interação espacial multimodal.
Hardware Principal
- WATCHER SenseCAP Watcher versão em inglês Terminal de interacao multimodal de borda · entrada de aquisicao de voz e reconhecimento visual
- GW reComputer RK3588-40 Controlador inteligente de borda · host de sistema de negocios e ponte MCP
- HMI reTerminal D1001 Tela touchscreen inteligente industrial de 8 polegadas · interface humano-computador de estação de trabalho
- GPU reComputer J4012 (Jetson Orin NX 16GB) Host de capacidade computacional avançada L3 · pipeline de voz puramente local offline
O que este módulo resolve
Em cenários como gestão de armazéns, guias de exposições e recepções inteligentes, a equipe no local precisa interromper o trabalho manual para buscar dados de negócios via teclado ou celular, com baixa eficiência. Os terminais de interação tradicionais carecem de contexto visual e não percebem proativamente a aproximação de pessoas ou ações anômalas. Os terminais inteligentes são frequentemente ecossistemas fechados, difíceis de integrar com sistemas WMS/ERP/CRM existentes; alguns cenários industriais e governamentais proíbem o upload de áudio e dados de negócios para a internet pública.
- Dificuldade
- Avançado
- Duração
- L1 1 dia / L2 2–3 dias / L3 3–5 dias
- Formato Mais Curto
- 1 dia (aula experimental · L1)
- Formato de Ensino
- 3 camadas: experimental / prático / de entrega
- Protocolo central
- MCP / REST API / Wi-Fi
- Capacidade computacional offline L3
- 100 TOPS(Jetson Orin NX 16GB)
L1 sem base ou primeiro contato com dispositivos de interação de IA de borda; L2 requer base em Docker e experiência com chamadas REST API; L3 requer base em Linux, PyTorch/Jetson e capacidade de operação via shell
Cenários típicos de aplicação
Competências-Chave
- Detecção de objetos por visão de borda e acionamento de eventos
- Consulta por voz em linguagem natural e configuração de papéis de Agent
- Chamada de ferramentas de sistemas de negócios baseada no protocolo MCP
- Implantação Docker de sistema WMS local e integração de API
- Implantação de pipeline de IA de voz puramente local offline (VAD→ASR→LLM→TTS)
Hardware do curso
Este curso usa como ferramenta de ensino central os "terminais de IA visíveis + poder computacional de inferência local".

SenseCAP Watcher (versão em inglês)
Terminal de interação multimodal de borda, ponto de entrada para captura de voz e reconhecimento visual
Integra captura audiovisual e exibição em tela, suporta detecção de objetos, percepção de aproximação de pessoas e interação por voz em linguagem natural, conectando-se à plataforma SenseCraft AI via Wi-Fi. SKU 100051523, 2 unidades por grupo.

Controlador Inteligente de Borda reComputer RK3588-40
Host de borda que executa sistemas de negócios e serviços de ponte MCP
16GB de memória, 6 TOPS de capacidade computacional; executa o sistema de armazenamento WMS em contêiner Docker e o serviço de ponte MCP Bridge, integrando dados de negócios na rede local com chamadas de ferramentas de modelos de linguagem. SKU 100086238, com adaptador de alimentação 12V integrado.

Tela Touchscreen Inteligente reTerminal D1001 de 8 Polegadas
Interface humano-computador da estação de trabalho, entrada de dados de negócios de armazenamento e monitoramento de status
Terminal inteligente touchscreen industrial de 8 polegadas, com câmera e microfones duplos, SKU 100058144. Como interface de interação humano-computador da estação de trabalho, é usado para entrada de dados de negócios de armazenamento e monitoramento de status; pode ser conectado diretamente ao host para exibir o console de gerenciamento WMS e logs de interação.

reComputer J4012(Jetson Orin NX 16GB)
Host de computação de borda avançado L3, implanta pipeline de voz puramente local offline
Capacidade computacional de nível 100 TOPS, com ambiente JetPack/CUDA/TensorRT/PyTorch pré-instalado; implanta o pipeline de IA de voz puramente local offline Silero VAD + Whisper ASR + Qwen LLM + ChatTTS, funcionando mesmo sem internet. SKU 114110314, com adaptador de alimentação 19V/4.7A.
São configurados adicionalmente monitor portátil de campo (13,3" 1080P), roteador CUDY AX3000 Wi-Fi 6, filtro de linha, cabos de rede gigabit Cat6, pacote de materiais para simulação prática de WMS de armazenamento inteligente (etiquetas de código de barras/etiquetas de localização/caixas de amostra físicas), suporte de mesa Watcher e outros acessórios comuns.
Codecraft ajuda você a "ousar fazer", aily-blockly ajuda você a "concluir"
O M0 não usa o Arduino IDE para escrever C++ manualmente, mas adota a cadeia de ferramentas em dois estágios desenvolvida pela Seeed. A primeira metade: zero instalação, resultados em 5 minutos; a segunda metade: traga o projeto para seu próprio computador, transformando-o em uma engenharia que pode ser levada e continuamente evoluída.
SenseCraft AI + Watcher
Modelo de linguagem em nuvem + terminal multimodal de borda · configuracao sem codigo
- Configuração de rede e vinculação Watcher
- Configuracao de modelo visual e papel de Agent
- Experiencia de consulta por voz e chamada de ferramentas MCP
MCP Bridge + Docker + OpenClaw
Ponte de protocolo padrao · dados de negocios da rede local nao saem do dominio
- Deploy do WMS local via Docker
- Configuração config.yml da ponte MCP
- Registro e integração de ferramentas de automação OpenClaw
Jetson Orin NX + pipeline de voz offline
Ciclo fechado puramente local VAD→ASR→LLM→TTS · zero dependência de rede pública
- Validação do ambiente JetPack
- Deploy de modelo quantizado e otimizacao de memoria de video
- Integracao sem rede e otimizacao de latencia
L1/L2 dependem de conexão com internet para serviços de modelos de linguagem; L3 requer capacidade computacional de borda de nível 100 TOPS (Jetson Orin NX 16GB), o RK3588-40 (6 TOPS) não suporta inferência de modelos de linguagem locais.
Progressão em três níveis: Demonstração → Consultoria → Design
Experiência de capacidades de interação multimodal
Tenha um assistente de voz de IA exclusivo, consulte dados e controle dispositivos diretamente por meio da fala cotidiana
- Compreender a arquitetura técnica da combinação entre visão de borda e Agentes de grandes modelos
- Dominar o papel central do protocolo MCP na integração entre IA de borda e sistemas de negócios
- Dominar a lógica de escolha entre colaboração em nuvem e implantação local em diferentes cenários de negócios
Integração de sistemas de negócios e configuração de vinculação
Integre sistemas internos de negocios, permita que a interacao por voz flua diretamente em ordens de servico, simplifique operacoes complicadas
- Configurar independentemente os parâmetros visuais e de Agent de voz do Watcher
- Dominar a implantação de sistemas de negócios locais e serviços de ponte MCP baseados em Docker
- Dominar o método de extensão de novas APIs de negócios baseado no protocolo MCP
Implantação de pipeline de IA de voz local offline ponta a ponta
Implemente deploy puramente local offline, utilizavel sem rede e com dados centrais de negocios nunca saindo da rede interna
- Dominar a arquitetura completa do pipeline de voz local ponta a ponta VAD→ASR→LLM→TTS
- Dominar métodos de quantização e otimização de implantação de grandes modelos em hardware de computação de borda Jetson
- Capacidade de entregar soluções de interação com IA em ambientes de privacidade rigorosa e redes industriais isoladas
Curriculum / 15 módulos de ensino
A ordem dos módulos não muda, a divisão é você quem define
Escolha um formato e veja quais módulos ele cobre. A versão completa é o mesmo curso organizado de três maneiras — conteúdo, hardware e entregáveis são idênticos, apenas a divisão difere.
| Módulo / Resultado | Experimental1 dia | Prático2–3 dias | Entrega3–5 dias | ||
|---|---|---|---|---|---|
| 01 | Preparação pré-aula e verificação prévia de ambienteInventario de bancada de hardware, teste de conectividade de rede, pre-verificacao de firmware Watcher e inicializacao de conta de plataforma, pre-instalacao de ambiente Docker RK3588-40 e imagem WMS, pre-carregamento de ambiente JetPack J4012, preparacao de materiais didaticos | — | Completo | Completo | Completo |
| 02 | Arquitetura de interacao multimodal e conceitos centraisAnalise de visao de borda, Agent de voz, protocolo MCP e arquitetura de colaboracao nuvem-borda; diferencas tecnicas e base de selecao entre as duas formas de deploy: colaboracao em nuvem e local offline | SenseCraft AI | Completo | Completo | Completo |
| 03 | Experiencia de inferencia de visao leve de bordaExperiência com modelo de detecção de objetos Watcher (reconhecimento de materiais, aproximação de pessoas, percepção de ações específicas), adaptação de modelo visual sem código SenseCraft AI, análise de formato de saída de dados UART e de rede | SenseCAP Watcher | Completo | Completo | Completo |
| 04 | Perguntas e respostas por voz contextualizadas e mecanismo de AgentDemonstracao de consulta em tempo real em linguagem natural para cenarios de armazenamento/varejo, experiencia de cadeia completa de entrada de voz -> inferencia -> sintese de voz e anuncios, configuracao de prompts e papeis de Agent, comparacao de mecanismos de memoria de dialogo (sem memoria/curto prazo/longo prazo) | SenseCraft AI Agent | Completo | Completo | Completo |
| 05 | Demonstração de chamada de ferramentas MCP e integração de negóciosDemonstracao de chamada de ferramentas externas baseada em protocolo MCP (consulta em tempo real ao banco de dados de armazenamento), demonstracao de cadeia completa de gerenciamento inteligente de armazem (consulta de estoque/entrada/saida por voz), demonstracao de vinculacao de automacao de desktop OpenClaw | MCP / OpenClaw | Completo | Completo | Completo |
| 06 | Configuração de IA visual Watcher e rede de bordaConfiguração de rede Watcher e vinculação à plataforma SenseCraft, seleção de modelo visual e ajuste de parâmetros de confiança/limiar de acionamento, configuração de regras de relato de eventos (aparecimento de objeto, detecção de zona) | SenseCraft AI / Watcher | Não inclui | Completo | Completo |
| 07 | Configuracao de Agent de voz e prompts de papelDefinicao de papel de Agent (assistente de armazem/guia de exposicao), configuracao de System Prompt e estilo de interacao, troca de modo de memoria e validacao de efeitos | SenseCraft AI Agent | Não inclui | Completo | Completo |
| 08 | Deploy do sistema de gerenciamento de negocios local via DockerDeploy do WMS de exemplo (suharvest/warehouse_system) no RK3588-40 usando Docker e Git, acesso ao console de gerenciamento para conclusao da inicializacao do administrador e geracao de API Key, importacao de materiais de demonstracao e dados de localizacao de estoque | Docker / WMS | Não inclui | Completo | Completo |
| 09 | Configuração e integração do serviço de ponte MCPObtencao de ponto de acesso e informacoes de autenticacao MCP do Watcher, edicao do config.yml para configurar endereco de API e API Key do sistema de negocios local, inicializacao do servico MCP Bridge e validacao do estado de handshake do ponto de acesso | MCP Bridge | Não inclui | Completo | Completo |
| 10 | Vinculação de tarefas de automação OpenClawDeploy do ambiente de ferramentas de automacao OpenClaw, registro de scripts de automacao como ferramentas chamaveis por MCP, configuracao de consulta de automacao acionada por comando de voz e tarefas agendadas | OpenClaw | Não inclui | Completo | Completo |
| 11 | Integracao e depuracao de cadeia completa e solucao de falhasExecucao de integracao de comandos de negocios tipicos (consulta de estoque, submissao de entrada, rastreamento logistico), solucao de problemas comuns de timeout de rede/falha de autenticacao API/conflito de portas | — | Não inclui | Completo | Completo |
| 12 | Analise da arquitetura do pipeline de voz local offlineAnálise das responsabilidades de cada módulo VAD/ASR/LLM/TTS e latência de fluxo de dados, comparação de métricas entre solução offline e solução em nuvem (latência ponta a ponta, limite de concorrência, uso de memória de vídeo e conformidade de privacidade) | — | Não inclui | Não inclui | Completo |
| 13 | Ambiente de execução Jetson e otimização de implantação de modelosValidacao do ambiente de execucao JetPack/CUDA/TensorRT/PyTorch, deploy do modelo de reconhecimento de voz ASR (Whisper/FunASR), deploy do LLM local quantizado de 4-bit (Qwen2.5-7B-Instruct) e mecanismo TTS (ChatTTS/Piper), direcionamento do fluxo de audio do Watcher para a porta do servico local | Jetson Orin NX | Não inclui | Não inclui | Completo |
| 14 | Integracao sem rede e otimizacao de latenciaValidacao de operacao de ciclo fechado autonomo da rede local com desconexao fisica da internet, teste de tempo gasto em cada etapa, otimizacao do comprimento de contexto do modelo e parametros de amostragem | — | Não inclui | Não inclui | Completo |
| 15 | Revisão da solução e resumo de entregaApresentacao de resultados de cada grupo e defesa de adaptacao de cenario de negocios, revisao de custos e selecao entre arquitetura SaaS em nuvem vs arquitetura de computacao de borda local, normas de extensao de API de sistemas de negocios e arquivamento de documentos de entrega padronizados | — | Reduzido | Completo | Completo |
● Completo◐ Reduzido— Não inclui●+ Mais aprofundado que o completo
A chave coverage corresponde ao ID do formato de curso (taster / workshop / bootcamp), os valores são full (cobertura completa) / part (cobertura simplificada) / none (não incluído) / plus (mais profundo que a versão completa). A aula experimental (taster) foca na experiência de borda L1 e na demonstração de chamadas de ferramentas MCP, não inclui implantação de sistema de negócios local nem pipeline offline; a aula prática (workshop) cobre a configuração Watcher completa L1+L2, implantação WMS e ponte MCP; a aula de entrega (bootcamp) cobre completamente L1+L2+L3, incluindo implantação de pipeline de voz offline Jetson.
Primeiro escolha o nível, depois o formato
O tempo e o objetivo determinam qual nível escolher: se você quer que o aluno leve um projeto que possa continuar evoluindo, escolha a versão completa; se tem apenas dois dias, escolha a versão hackathon; se tem apenas meio dia, escolha uma das duas oficinas rápidas.
Sessão Experimental
Sem FP1 dia · 6–8h · L1 Camada de Demonstração · foco em experiência de borda e demonstração de chamadas de ferramentas MCP
- Dia 1 manhãMódulos 01 + 02 + 03
Pre-verificacao ambiental -> conceito de arquitetura multimodal -> experiencia de inferencia de visao de borda
- Dia 1 tardeMódulos 04 + 05 + 15 (compacto)
Perguntas e respostas por voz e mecanismo de Agent -> chamada de ferramentas MCP e demonstracao de integracao de negocios -> revisao e resumo
O objetivo da aula experimental e "compreender, saber explicar, saber demonstrar", obtendo em 3 minutos o efeito de demonstracao de consulta por voz e vinculacao de acionamento visual. Nao inclui implantacao de sistema de negocios local nem pipeline de voz offline.
Aula prática
FP completo2–3 dias · 14–20h · L1+L2 · configuração Watcher + implantação WMS local + ponte MCP + vinculação de automação
- Day 1Módulos 01–05
Pre-verificacao ambiental -> arquitetura multimodal -> visao de borda -> Agent de voz -> demonstracao de chamada de ferramentas MCP
- Day 2Módulos 06–09
Configuração visual Watcher → prompt de papel do Agent → implantação WMS Docker → integração de ponte MCP
- Dia 3 (opcional)Modulos 10 + 11 + 15
Vinculação de automação OpenClaw → integração de cadeia completa → revisão de solução e resumo de entrega
A aula pratica entrega 1 integracao completa de sistema multimodal contendo percepcao visual, Agent de voz, WMS local e ferramentas de automacao. Requisitos basicos dos alunos: possuir base em Docker e experiencia com chamadas REST API.
Aula de entrega
FP completo3–5 dias · 24–35h · L1+L2+L3 · cobertura completa incluindo implantação de pipeline de voz offline Jetson e validação sem rede
- Day 1–2Modulos 01-11
Conteúdo completo L1+L2 (experiência de borda + configuração Watcher + implantação WMS + ponte MCP + integração de cadeia completa)
- Day 3Modulo 12
Analise da arquitetura do pipeline de voz local offline
- Day 4Modulo 13
Ambiente de execução Jetson e implantação/otimização de modelos ASR/LLM/TTS
- Day 5Modulos 14 + 15
Integracao sem rede e otimizacao de latencia -> revisao de solucao e arquivamento de entrega
O objetivo da aula de entrega e desenvolver capacidade de entregar solucoes de interacao de IA em ambientes de forte privacidade e rede isolada industrial. Requisitos basicos dos alunos: possuir base em Linux, PyTorch/Jetson e operacao shell, familiarizar-se com as capacidades L1-L2.
A aula experimental e o formato padrao para demonstracao de solucoes e comunicacao com clientes: zero barreira de deploy, ciclo fechado em 1 dia, foco em "voz consegue consultar, visao consegue acionar". Adequado para feiras, dias de abertura tecnologica e cenarios de primeiro contato com clientes.
O Dia 3 da aula pratica e um dia elastico opcional: se os alunos tiverem boa base, pode ser comprimido para 2 dias (a tarde do Dia 2 combina OpenClaw e integracao de cadeia completa); se for necessario mais tempo para ajuste de ponte MCP, use os 3 dias completos.
A solução de colaboração em nuvem L1/L2 requer que o local tenha banda de internet de uplink estável, para chamadas à plataforma SenseCraft AI e serviços de modelos de linguagem; em ambiente sem internet, L1/L2 não podem ser executados, sendo necessário alternar para a solução offline L3.
A precisao do reconhecimento de voz e afetada pelo ruido de fundo do ambiente no local, sotaques dialetais e vocabulario profissional do setor; em ambientes industriais de alto ruido, e necessario configurar dispositivo de captação direcional, nao garante efeito de captacao cega de campo distante.
A solução puramente local L3 depende de hardware GPU de borda de nível 100 TOPS (Jetson Orin NX 16GB ou superior), o RK3588-40 de 6 TOPS não suporta inferência de modelos de linguagem locais.
A aula experimental nao inclui implantacao de sistema de negocios local nem pipeline de voz offline; por favor, nao prometa ao cliente que os alunos da aula experimental conseguem concluir independentemente a implantacao WMS ou a construcao de pipeline offline — esses sao os padroes de entrega das aulas pratica e de entrega.
Para quem é este curso
O valor deste curso nao esta nos modelos de linguagem, mas no metodo de "integrar sistemas de negocios a interacao por voz"
M2 não é um curso que ensina alunos a "conversar com IA", mas um curso metodológico que ensina equipes a usar terminais de IA físicos e protocolos padrão para integrar sistemas WMS/ERP/CRM já existentes no local à interação em linguagem natural. A Chaihuo entrega não apenas "uma aula", mas um conjunto completo que pode ser desmontado, reescrito e remontado: estrutura de curso de 15 módulos, planos de aula e PPT para professores, modelos de configuração Watcher, exemplo de config.yml de ponte MCP, arquivos de implantação Docker Compose, manual de implantação de pipeline de voz offline.
Abertura 01
Trocar de cenário
O conteudo de consulta do Modulo 04 "Perguntas e respostas por voz contextualizadas" e aberto: seu setor, o local do seu cliente, um problema real que esta acontecendo nesta cidade. Consultar estoque pode ser armazenamento, pode ser itens de exposicao, pode ser agenda de salas de reuniao — quanto mais o problema se aproxima do cenario real, melhor o efeito, e isso voce entende melhor do que nos.
Abertura 02
Conectar sistemas
Os sistemas de negocios existentes dos seus clientes, o software de gerenciamento na plataforma de treinamento da escola, os servicos REST API dos parceiros — podem ser conectados apos o modulo 08, tornando-se o pool de objetos para o exercicio de ponte MCP. O M2 e responsavel por explicar o metodo a fundo; qual sistema conectar apos a porta, voce decide.
Abertura 03
Adicione o Seu
Aquilo que voce acumulou no setor: experiencia de ajuste de prompts de Agent, armadilhas de autenticacao MCP que enfrentou, a metafora que faz os alunos entenderem instantaneamente a latencia do pipeline de voz, as tres perguntas de privacidade mais frequentes no local do cliente — isso e exatamente o que nao temos e nao podemos oferecer.
O melhor destino de um curso de interação de IA não é ser executado completamente uma vez, mas ser transformado por um engenheiro além do reconhecimento, tornando-se a solução que só ele pode entregar.
Limites de Escopo e Conformidade
Princípios Fundamentais
Os dados de negócios L1/L2 fluem na rede local via ponte MCP local, os dados centrais não saem do domínio; L3 executa puramente local offline, com zero dependência de rede pública.
No Escopo
- Percepcao de objetos no local e perguntas e respostas por voz de negocios estruturadas
- Chamada de ferramentas de sistemas WMS/ERP/CRM baseada em protocolo MCP
- Acionamento de eventos visuais de borda e vinculacao de tarefas de automacao
- Interacao multimodal em cenarios como armazenamento inteligente, guia de exposicao, recepcao inteligente
- Interacao de voz puramente local offline em ambientes de forte privacidade e rede isolada industrial (L3)
Fora do Escopo
- Não substitui sistemas dedicados de atendimento humano de alta concorrência e longa cadeia
- Não garante raciocínio 100% preciso para lógica subjetiva ambígua de múltiplas rodadas
- Não inclui desenvolvimento de engenharia reversa de sistemas legados fechados cuja API não foi aberta pelo cliente
- Não se aplica à captação cega de campo distante em ambientes industriais de alto ruído (requer configuração de captação direcional)
- A solução L1/L2 depende de conexão com internet para serviços de modelos de linguagem; em ambiente sem internet, é necessário alternar para a solução offline L3
- A solução offline L3 requer capacidade computacional de borda de nível 100 TOPS (Jetson Orin NX 16GB ou superior), o RK3588-40 (6 TOPS) não suporta inferência de modelos de linguagem locais
- A precisao do reconhecimento de voz e afetada pelo ruido de fundo do ambiente no local, sotaques dialetais e vocabulario profissional do setor; nao garante indicador de precisao de reconhecimento em cenarios especificos