Volver a la matriz de aprendizaje
M2 Di adiós a las interfaces de sistema tediosas y las operaciones complejas; con solo hablar puedes consultar datos, gestionar negocios y controlar dispositivos

Interacción de IA Multimodal

Basado en terminales de IA físicos, integra visión en el borde, voz y APIs de sistemas de negocio para lograr la interacción espacial multimodal.

Interacción de IA Multimodal Ilustración

Hardware Principal

  • WATCHER SenseCAP Watcher, versión en inglés XiaoZhi Terminal de interaccion multimodal en dispositivo · entrada de captura de voz y reconocimiento visual
  • GW reComputer RK3588-40 Controlador inteligente en el borde · host de sistema de negocio y puente MCP
  • HMI reTerminal D1001 Pantalla táctil inteligente industrial de 8 pulgadas · interfaz hombre-máquina de estación de trabajo
  • GPU reComputer J4012 (Jetson Orin NX 16GB) Host de cómputo avanzado L3 · pipeline de voz puramente local y offline

Qué resuelve este módulo

En escenarios como gestión de almacenes, guías de salas de exposición y recepciones inteligentes, el personal en sitio debe detener las operaciones manuales para buscar datos de negocio mediante teclado o teléfono, con baja eficiencia. Los terminales de interacción tradicionales carecen de contexto visual y no pueden percibir proactivamente la aproximación de personas o movimientos anómalos. Los terminales inteligentes suelen ser ecosistemas cerrados, difíciles de integrar con sistemas existentes WMS/ERP/CRM; algunos escenarios industriales y gubernamentales prohíben la subida de audio y datos de negocio a la red pública.

Dificultad
Avanzado
Duración
L1 1 día / L2 2–3 días / L3 3–5 días
Formato Más Corto
1 día (curso de iniciación · L1)
Formato de Enseñanza
3 niveles: iniciación / práctica / entrega
Protocolo central
MCP / REST API / Wi-Fi
Potencia de cómputo offline L3
100 TOPS(Jetson Orin NX 16GB)

L1 sin base o primer contacto con dispositivos de interacción de IA en el borde; L2 requiere base de Docker y experiencia en llamadas REST API; L3 requiere base de Linux, PyTorch/Jetson y capacidad de operaciones shell

Escenarios típicos de aplicación

Almacenes inteligentes y gestión de talleres: consulta de inventario sin operaciones manuales, registro de entrada/salida por voz, alertas visuales de materiales anómalos Salas de exposición y guías públicas: reconocimiento proactivo de personas, explicaciones por voz multilingües, control vinculado de stands Recepción inteligente y espacios de reunión: atención a visitantes, control por voz de dispositivos del espacio, consulta automatizada de agendas Cuidado asistido y servicios espaciales: alertas de detección de comportamientos específicos, solicitud de ayuda por voz y vinculación remota Interacción por voz en zonas industriales aisladas: consulta de voz offline en red local pura y reporte de estados de dispositivos

Hardware Principal

  • SenseCAP Watcher (versión en inglés XiaoZhi)
  • Controlador inteligente en el borde reComputer RK3588-40
  • Pantalla tactil inteligente reTerminal D1001 de 8 pulgadas
  • reComputer J4012 (Jetson Orin NX 16 GB)

Capacidades Clave

  • Detección de objetos visuales en el borde y activación de eventos
  • Consulta de voz en lenguaje natural y configuración de roles de Agente
  • Llamadas a herramientas de sistemas de negocio basadas en el protocolo MCP
  • Despliegue Docker del sistema WMS local e integración de API
  • Despliegue de pipeline de IA de voz offline puramente local (VAD→ASR→LLM→TTS)

Hardware del curso

Este curso emplea como material didáctico central los «terminales de IA visibles + potencia de cómputo local de inferencia».

  • SenseCAP Watcher, versión en inglés XiaoZhi

    SenseCAP Watcher (versión en inglés XiaoZhi)

    Terminal de interacción multimodal en el borde, entrada de captura de voz y reconocimiento visual

    Integra captura audio/video y visualizacion en pantalla, soporta deteccion de objetos, percepcion de aproximacion de personas e interaccion por voz en lenguaje natural, se conecta a la plataforma SenseCraft AI mediante Wi-Fi. SKU 100051523, 2 unidades por grupo.

  • Controlador inteligente en el borde reComputer RK3588-40

    Controlador inteligente en el borde reComputer RK3588-40

    Host en el borde que ejecuta sistemas de negocio y servicios de puente MCP

    16GB de memoria, 6 TOPS de potencia de computo, ejecuta sistema de gestion de almacenes WMS contenerizado en Docker y servicio de puente MCP Bridge, logrando la integracion entre datos de negocio en red local y llamadas a herramientas de grandes modelos. SKU 100086238, con adaptador de alimentacion 12V integrado.

  • Pantalla tactil inteligente reTerminal D1001 de 8 pulgadas

    Pantalla tactil inteligente reTerminal D1001 de 8 pulgadas

    Interfaz hombre-maquina de estacion de trabajo, entrada de datos de negocio de almacenamiento y monitoreo de estado

    Terminal tactil inteligente industrial de 8 pulgadas, con camara y doble microfono, SKU 100058144. Como interfaz hombre-maquina de estacion de trabajo, se utiliza para entrada de datos de negocio de almacenamiento y monitoreo de estado, puede conectarse directamente al host para mostrar la consola de administracion WMS y registros de interaccion.

  • reComputer J4012 Jetson Orin NX 16GB

    reComputer J4012 (Jetson Orin NX 16 GB)

    Host de cómputo en el borde avanzado de L3, despliega pipeline de voz offline puramente local

    Potencia de computo de nivel 100 TOPS, con entorno JetPack/CUDA/TensorRT/PyTorch preinstalado, despliega pipeline de IA de voz puramente local y offline Silero VAD+Whisper ASR+Qwen LLM+ChatTTS, utilizable incluso sin red. SKU 114110314, con adaptador de alimentacion 19V/4.7A.

Adicionalmente se incluyen monitor portatil de sitio (13.3" 1080P), router CUDY AX3000 Wi-Fi 6, regleta de alimentacion, cables de red gigabit categoria 6, paquete de materiales de simulacion practica de WMS de gestion inteligente de almacenes (etiquetas de codigo de barras/etiquetas de ubicacion/cajas de muestra fisicas), soporte de escritorio Watcher y otros accesorios generales.

Codecraft le ayuda a "atreverse", aily-blockly le ayuda a "terminar"

M0 no utiliza Arduino IDE para escribir C++ manualmente, sino que emplea una cadena de herramientas de doble plataforma desarrollada por Seeed. La primera mitad: cero instalación, resultados en 5 minutos; la segunda mitad: traslade el proyecto a su propio ordenador, convirtiéndolo en un proyecto portable y evolutivo.

SenseCraft AI + Watcher

Grandes modelos en nube + terminal multimodal en dispositivo · configuración sin código

  1. Configuración de red y vinculación Watcher
  2. Configuracion de modelo visual y rol de Agent
  3. Experiencia de consulta por voz y llamadas a herramientas MCP

MCP Bridge + Docker + OpenClaw

Puente de protocolos estandar · datos de negocio de red local no salen del dominio

  1. Despliegue Docker de WMS local
  2. Configuración config.yml del puente MCP
  3. Registro e integración de herramientas de automatización OpenClaw

Jetson Orin NX + pipeline de voz offline

Ciclo cerrado puramente local VAD→ASR→LLM→TTS · cero dependencia de red pública

  1. Verificación de entorno JetPack
  2. Despliegue de modelo cuantizado y optimizacion de memoria de video
  3. Integracion sin red y optimizacion de latencia
Punto de inflexión clave · de la colaboración en nube al despliegue privatizado local y offlineLa solución en nube SenseCraft AI resuelve la «verificación rápida y lista para usar»; el puente MCP permite que los datos de negocio cierren ciclo dentro de la red local por primera vez, los datos centrales de inventario y negocio no salen del dominio; el pipeline offline Jetson corta completamente la dependencia de red pública, logrando interacción de voz sin internet en entornos de alta privacidad y redes aisladas industriales.

L1/L2 dependen de conexión a internet para servicios de grandes modelos; L3 requiere potencia de cómputo en el borde de nivel 100 TOPS (Jetson Orin NX 16GB), el RK3588-40 (6 TOPS) no puede soportar inferencia de grandes modelos locales.

Progresión en tres niveles: Demostración → Consultor → Diseño

L1 · Nivel de Demostración 1 días

Experiencia de capacidades de interacción multimodal

Ten tu propio asistente de voz con IA, consulta datos y controla dispositivos directamente hablando normalmente

  • Comprender la arquitectura técnica de la combinación de visión en el borde y Agentes de grandes modelos
  • Dominar el papel central del protocolo MCP en la integración entre IA en el borde y sistemas de negocio
  • Dominar la lógica de selección entre colaboración en la nube y despliegue local en diferentes escenarios de negocio
L2 · Nivel de Consultor 3 días

Integración de sistemas de negocio y configuración de vinculación

Conecta los sistemas de negocio internos, permite que la interacción por voz fluya directamente en órdenes de trabajo y simplifica las operaciones tediosas

  • Configurar de forma independiente los parámetros de Agente visual y de voz de Watcher
  • Dominar el despliegue de sistemas de negocio locales y servicios de puente MCP basados en Docker
  • Dominar el método para extender nuevas APIs de negocio basadas en el protocolo MCP
L3 · Nivel de Diseño 5 días

Despliegue de pipeline de IA de voz offline local extremo a extremo

Logra un despliegue puramente local y offline, utilizable sin conexión de red y con los datos centrales de negocio que nunca salen de la red interna

  • Dominar la arquitectura completa del pipeline de voz local extremo a extremo VAD→ASR→LLM→TTS
  • Dominar los métodos de cuantización y optimización de despliegue de grandes modelos en hardware de computación en el borde Jetson
  • Capacidad para entregar soluciones de interacción de IA en entornos de alta privacidad y redes industriales aisladas

Curriculum / 15 módulos de enseñanza

El orden de los módulos es fijo, la forma de impartirlos la elige usted

Seleccione una modalidad y vea qué módulos cubre. La versión completa es el mismo curso con tres formas de impartirlo — el contenido, el hardware y los entregables son exactamente iguales, solo cambia la segmentación.

15módulos de enseñanza y su profundidad de cobertura en cada modalidad
Módulo / EntregableIniciación1 díaPráctica2–3 díasEntrega3–5 días
01Preparación previa al curso y verificación de entornoInventario de banco de hardware, prueba de conectividad de red, verificacion previa de firmware Watcher e inicializacion de cuenta de plataforma, entorno Docker RK3588-40 e imagen WMS preinstalada, entorno JetPack J4012 precargado, preparacion de materiales docentes—CompletoCompletoCompleto
02Arquitectura de interacción multimodal y conceptos centralesAnalisis de arquitectura de vision en el borde, Agent de voz, protocolo MCP y colaboracion nube-borde; diferencias tecnicas y base de seleccion entre dos formas de despliegue: colaboracion en nube y local offlineSenseCraft AICompletoCompletoCompleto
03Experiencia de inferencia visual ligera en dispositivoExperiencia con modelo de detección de objetos Watcher (reconocimiento de materiales, aproximación de personas, percepción de acciones específicas), adaptación de modelo visual sin código SenseCraft AI, análisis de formatos de salida de datos UART y de redSenseCAP WatcherCompletoCompletoCompleto
04Preguntas y respuestas por voz contextualizadas y mecanismo de AgentDemostración de consulta en tiempo real por lenguaje natural en escenarios de almacenamiento/venta minorista, experiencia de cadena completa de entrada de voz→inferencia→reproducción por síntesis de voz, prompts de Agent y configuración de roles, comparación de mecanismos de memoria de diálogo (sin memoria/corto plazo/largo plazo)SenseCraft AI AgentCompletoCompletoCompleto
05Demostración de llamadas a herramientas MCP e integración de negocioDemostración de llamadas a herramientas externas basadas en protocolo MCP (consulta en tiempo real a base de datos de almacén), demostración de cadena completa de gestión inteligente de almacenes (consulta de inventario/entrada/salida por voz), demostración de vinculación de automatización de escritorio OpenClawMCP / OpenClawCompletoCompletoCompleto
06Configuración de IA visual Watcher y red en dispositivoConfiguración de red Watcher y vinculación a plataforma SenseCraft, selección de modelo visual y optimización de parámetros de confianza/umbral de activación, configuración de reglas de reporte de eventos (aparición de objetos, detección de zonas)SenseCraft AI / WatcherNo incluidoCompletoCompleto
07Configuracion de Agent de voz y prompts de rolDefinición de roles de Agent (asistente de almacén/guía de sala de exposiciones), configuración de System Prompt y estilo de interacción, cambio de modos de memoria y verificación de efectosSenseCraft AI AgentNo incluidoCompletoCompleto
08Despliegue Docker de sistema de gestion de negocio localDespliegue del WMS de ejemplo (suharvest/warehouse_system) en RK3588-40 mediante Docker y Git, acceso a la consola de administración para completar la inicialización de administrador y generación de API Key, importación de materiales de demostración y datos de ubicaciones de almacénDocker / WMSNo incluidoCompletoCompleto
09Configuración e integración del servicio de puente MCPObtencion de punto de acceso y autenticacion MCP de Watcher, edicion de config.yml para configurar direccion API y API Key del sistema de negocio local, inicio del servicio MCP Bridge y verificacion del estado de handshake del punto de accesoMCP BridgeNo incluidoCompletoCompleto
10Vinculación de tareas de automatización OpenClawDespliegue del entorno de herramientas de automatizacion OpenClaw, registro de scripts de automatizacion como herramientas invocables por MCP, configuracion de activacion de consultas de automatizacion y tareas programadas mediante comandos de vozOpenClawNo incluidoCompletoCompleto
11Integración de cadena completa y depuración de fallosIntegración de ejecución de comandos de negocio típicos (consulta de inventario, envío de entrada, seguimiento logístico), depuración de problemas comunes de tiempo de espera de red/fallo de autenticación API/conflicto de puertos—No incluidoCompletoCompleto
12Analisis de arquitectura de pipeline de voz offline localAnálisis de responsabilidades de cada módulo VAD/ASR/LLM/TTS y latencia de flujo de datos, comparación de indicadores entre solución offline y solución en nube (latencia de extremo a extremo, límites de concurrencia, uso de memoria de video y cumplimiento de privacidad)—No incluidoNo incluidoCompleto
13Entorno de ejecución Jetson y optimización de despliegue de modelosVerificacion del entorno de ejecucion JetPack/CUDA/TensorRT/PyTorch, despliegue de modelo de reconocimiento de voz ASR (Whisper/FunASR), despliegue de LLM local cuantizado de 4 bits (Qwen2.5-7B-Instruct) y motor TTS (ChatTTS/Piper), direccionamiento del flujo de audio de Watcher al puerto de servicio localJetson Orin NXNo incluidoNo incluidoCompleto
14Integracion sin red y optimizacion de latenciaVerificacion de operacion de ciclo cerrado autonomo de red local mediante desconexion fisica de internet, medicion de tiempo de cada etapa, optimizacion de longitud de contexto y parametros de muestreo del modelo—No incluidoNo incluidoCompleto
15Revisión de soluciones y resumen de entregaPresentación de resultados de cada grupo y defensa de adaptación a escenarios de negocio, revisión de costos y selección entre arquitectura SaaS en nube vs arquitectura de cómputo en el borde local, archivo de especificaciones de extensión API de sistemas de negocio y documentos de entrega estandarizados—ReducidoCompletoCompleto

● Completo◐ Reducido— No incluido●+ Más profundo que la versión completa

La clave coverage corresponde al ID de formato de curso (taster / workshop / bootcamp), los valores son full (cobertura completa) / part (cobertura reducida) / none (no incluido) / plus (más profundo que la versión completa). La clase de experiencia (taster) se enfoca en la experiencia en dispositivo y demostración de llamadas a herramientas MCP L1, no incluye despliegue de sistemas de negocio locales ni pipeline offline; la clase práctica (workshop) cubre la configuración completa Watcher, despliegue WMS y puente MCP L1+L2; la clase de entrega (bootcamp) cubre completamente L1+L2+L3, incluyendo despliegue de pipeline de voz offline Jetson.

Primero elija el nivel, luego la modalidad

El tiempo y el objetivo determinan qué nivel elegir: si quiere que los estudiantes se lleven un proyecto que puedan seguir desarrollando, elija la versión completa; si solo tiene dos días, elija la versión maratón; si solo tiene medio día, elija uno de los dos talleres experienciales.

  • Sesión de Iniciación

    Sin FP

    1 día · 6–8h · L1 capa de demostración · enfocado en experiencia en dispositivo y demostración de llamadas a herramientas MCP

    • Día 1 mañanaMódulos 01 + 02 + 03

      Verificacion previa del entorno → conceptos de arquitectura multimodal → experiencia de inferencia visual en dispositivo

    • Día 1 tardeMódulos 04 + 05 + 15 (simplificado)

      Preguntas y respuestas por voz y mecanismo de Agent → demostracion de llamadas a herramientas MCP e integracion de negocio → resumen y revision

    El objetivo de la clase de experiencia es «comprender, poder explicar y poder demostrar», lograr el efecto de demostración de consulta por voz y vinculación activada por visión en 3 minutos. No incluye despliegue de sistemas de negocio locales ni pipeline de voz offline.

  • Curso Práctico

    FP completo

    2–3 días · 14–20h · L1+L2 · configuración Watcher + despliegue WMS local + puente MCP + vinculación de automatización

    • Day 1Módulos 01–05

      Verificacion previa del entorno → arquitectura multimodal → vision en dispositivo → Agent de voz → demostracion de llamadas a herramientas MCP

    • Day 2Módulos 06–09

      Configuración visual Watcher → prompts de rol de Agent → despliegue WMS Docker → integración de puente MCP

    • Día 3 (opcional)Modulos 10 + 11 + 15

      Vinculación de automatización OpenClaw → integración de cadena completa → revisión de solución y resumen de entrega

    La clase práctica entrega 1 integración completa de sistema multimodal que incluye percepción visual, Agent de voz, WMS local y herramientas de automatización. Requisitos básicos de los estudiantes: conocimientos básicos de Docker y experiencia en llamadas REST API.

  • Curso de Entrega

    FP completo

    3–5 días · 24–35h · L1+L2+L3 · cobertura completa incluyendo despliegue de pipeline de voz offline Jetson y verificación sin red

    • Day 1–2Modulos 01–11

      Contenido completo L1+L2 (experiencia en dispositivo + configuración Watcher + despliegue WMS + puente MCP + integración de cadena completa)

    • Day 3Modulo 12

      Analisis de arquitectura de pipeline de voz offline local

    • Day 4Modulo 13

      Entorno de ejecución Jetson y optimización de despliegue de modelos ASR/LLM/TTS

    • Day 5Modulos 14 + 15

      Integracion sin red y optimizacion de latencia → revision de solucion y archivo de entrega

    El objetivo de la clase de entrega es poseer la capacidad de entregar soluciones de interacción de IA en entornos de alta privacidad y redes aisladas industriales. Requisitos básicos de los estudiantes: conocimientos básicos de Linux, PyTorch/Jetson y operaciones shell, familiaridad con las capacidades L1–L2.

La clase de experiencia es el formato estándar para demostración de soluciones y comunicación con clientes: cero barreras de despliegue, ciclo cerrado de 1 día, enfocado en «la voz puede consultar y la visión puede activar». Adecuado para ferias, días de puertas abiertas tecnológicas y escenarios de primer contacto con clientes.

El Day 3 de la clase práctica es un día flexible opcional: si los estudiantes tienen buena base puede comprimirse a 2 días (la tarde del Day 2 combina OpenClaw y la integración de cadena completa); si se necesita más tiempo para la optimización del puente MCP se usan los 3 días completos.

La solución de colaboración en nube L1/L2 requiere que el sitio cuente con ancho de banda de internet ascendente estable para llamadas a la plataforma SenseCraft AI y servicios de grandes modelos; en entornos sin internet L1/L2 no pueden ejecutarse y se debe cambiar a la solución offline L3.

La precision del reconocimiento de voz se ve afectada por el ruido de fondo del entorno, los acentos dialectales y el vocabulario profesional de la industria; en sitios industriales de alto ruido se requiere configurar equipos de captacion direccional, no se garantiza el efecto de captacion ciega de campo lejano.

La solución puramente local L3 depende de hardware GPU en el borde de nivel 100 TOPS (Jetson Orin NX 16GB o superior), el RK3588-40 de 6 TOPS no puede soportar inferencia de grandes modelos locales.

La clase de experiencia no incluye despliegue de sistemas de negocio locales ni pipeline de voz offline; no prometa al cliente que los estudiantes de la clase de experiencia pueden completar de forma independiente el despliegue WMS o la construcción de pipeline offline — ese es el estándar de entrega de la clase práctica y la clase de entrega.

No son demos sueltas, son entregables que se pueden encender, validar y replicar

Lo siguiente corresponde a la entrega de la versión completa (clase de entrega); la clase práctica entrega los primeros 4 elementos; la clase de experiencia entrega la versión reducida de los elementos 1 y 2.

  • 01 Manual de configuración de hardware Watcher y parámetros de modelos visuales

    Incluye registro de configuración de red del dispositivo Watcher, selección de modelo visual y parámetros de confianza/umbral de activación, lista de configuración de reglas de reporte de eventos.

  • 02 Archivos de configuración de prompts de roles de Agente multimodal y estrategias de memoria

    Incluye System Prompt de rol de Agent, configuración de estilo de interacción, configuración de modos de memoria de diálogo (sin memoria/corto plazo/largo plazo) y registro de verificación de efectos.

  • 03 Guia de despliegue de sistema de negocio local y servicio de puente MCP

    Incluye archivo de despliegue Docker Compose, pasos de inicialización de consola de administración WMS, plantilla de configuración config.yml de MCP Bridge y especificaciones de gestión de API Key.

  • 04 Script de configuración de la herramienta de automatización OpenClaw

    Incluye pasos de despliegue del entorno OpenClaw, configuración para registrar scripts de automatización como herramientas invocables por MCP, ejemplos de configuración para activación de consultas de automatización y tareas programadas mediante comandos de voz.

  • 05 Manual de despliegue y optimización del pipeline de IA de voz offline local (L3)

    Incluye pasos de despliegue de cada módulo VAD→ASR→LLM→TTS, parámetros de asignación de memoria de video Jetson y optimización de modelos cuantizados, registro de pruebas de integración sin red y informe de pruebas de latencia de extremo a extremo.

A quién va dirigido

Consultores de soluciones y ventas comerciales Instructores de formación práctica y equipos de investigación educativa Ingenieros de informatización e inteligencia empresarial Docentes y estudiantes de institutos profesionales y universidades aplicadas

El valor de este curso no esta en los grandes modelos, sino en el metodo de «integrar sistemas de negocio en la interaccion por voz»

M2 no es una clase que enseña a los estudiantes a «chatear con IA», sino una clase de método que enseña a los equipos cómo usar terminales de IA físicos y protocolos estándar para integrar los sistemas WMS/ERP/CRM ya existentes en la interacción por lenguaje natural. Lo que Chaihuo entrega nunca es solo «una clase», sino un conjunto completo que puede desarmarse, reescribirse y reensamblarse: estructura de curso de 15 módulos, planes de clase y PPT para docentes, plantillas de configuración Watcher, ejemplos de config.yml de puente MCP, archivos de despliegue Docker Compose, manual de despliegue de pipeline de voz offline.

  • Apertura 01

    Cambiar de escenario

    El contenido de consulta del modulo 04 «preguntas y respuestas por voz contextualizadas» es abierto: tu industria, el sitio de tu cliente, un problema real que esta ocurriendo en esta ciudad. Consultar inventario puede ser gestion de almacen, puede ser exhibiciones de sala de exposiciones, puede ser agenda de salas de reunion — cuanto mas cerca este el problema de la realidad del sitio, mejor sera el efecto, y de esto tu sabes mas que nosotros.

  • Apertura 02

    Conectar sistemas

    Los sistemas de negocio de tus clientes existentes, el software de gestión en las plataformas de formación de escuelas y los servicios REST API de socios pueden conectarse después del módulo 08 para convertirse en el grupo de objetos para las prácticas de puente MCP. M2 se encarga de explicar el método a fondo; qué sistema se conecta detrás de la puerta, tú lo decides.

  • Apertura 03

    Añade lo Tuyo

    Todo lo que has acumulado en la industria: experiencia en optimización de prompts de Agent, los problemas de autenticación MCP que has superado, esa metáfora que hace que los estudiantes entiendan instantáneamente la latencia del pipeline de voz, las tres preguntas de privacidad más frecuentes en los sitios de los clientes — esa es precisamente la parte que nosotros no tenemos y no podemos dar.

El mejor destino de una clase de interacción de IA no es ser ejecutada completamente una vez, sino ser modificada hasta ser irreconocible por un ingeniero, y luego convertirse en esa solución que solo él puede entregar.
—— Feng Lei, autor de esta serie de cursos

Límites de Alcance y Cumplimiento

Principios Fundamentales

Los datos de negocio L1/L2 circulan dentro de la red local mediante el puente MCP local, los datos centrales no salen del dominio; L3 se ejecuta puramente local y offline, con cero dependencia de red pública.

Alcance

  • Percepcion de objetos en sitio y preguntas y respuestas por voz de negocio estructuradas
  • Llamadas a herramientas de sistemas WMS/ERP/CRM basadas en protocolo MCP
  • Activacion por eventos de vision en el borde y vinculacion de tareas de automatizacion
  • Interaccion multimodal en escenarios como almacenamiento inteligente, guia de salas de exposicion y recepcion inteligente
  • Interacción de voz puramente local y offline en entornos de alta privacidad y redes aisladas industriales (L3)

Fuera de Alcance

  • No sustituye los sistemas dedicados de atención al cliente humana de alta concurrencia y enlaces largos
  • No se garantiza una inferencia 100% precisa para lógicas de múltiples turnos vagas y subjetivas
  • No incluye desarrollo de ingeniería inversa para sistemas antiguos cerrados cuyas API no han sido abiertas por el cliente
  • No es aplicable a la captación ciega de campo lejano en sitios industriales de alto ruido (se requiere configurar captación direccional)
  • La solución L1/L2 depende de conexión a internet para servicios de grandes modelos; en entornos sin internet se debe cambiar a la solución offline L3
  • La solución offline L3 requiere potencia de cómputo en el borde de nivel 100 TOPS (Jetson Orin NX 16GB o superior), el RK3588-40 (6 TOPS) no puede soportar inferencia de grandes modelos locales
  • La precision del reconocimiento de voz se ve afectada por el ruido de fondo del entorno, los acentos dialectales y el vocabulario profesional de la industria; no se garantiza un indicador de precision de reconocimiento en escenarios especificos

Combinaciones curriculares que incluyen este módulo

M2 Interacción de IA Multimodal

Colabora con Nosotros