Volver a la matriz curricular
M2 Multimodal AI Interaction

Interacción de IA Multimodal

Libera tus manos, servicio proactivo: construye terminales de interacción de IA que entienden el negocio y ven las necesidades.

Interacción de IA Multimodal Ilustración

Qué resuelve este módulo

La operación del sistema requiere habilidades especializadas, la interacción física limita la eficiencia, la respuesta a la demanda siempre va rezagada — cuando los métodos de interacción se quedan atrás, las capacidades de IA no pueden aterrizar.

Dificultad Avanzado 2 días 4 tipos de público objetivo

Recomendado estudiar primero M1 Conectividad de Dispositivos y Control Inteligente

Escenarios típicos de aplicación

Guía Inteligente para Salas de Exposición Recepción Inteligente Comercio Minorista Inteligente Gestión de Almacenes Servicio Proactivo Espacial

Hardware Principal

  • Watcher
  • Array de Micrófonos
  • Host de IA en el Borde

Capacidades Clave

  • Entrenamiento sin código con SenseCraft AI
  • Interacción multimodal con Watcher
  • Despliegue local de LLM
  • Desarrollo de herramientas MCP

Hardware del curso

Este curso emplea como material didáctico central los «terminales de IA visibles + potencia de cómputo local de inferencia».

  • Caja de Computación en el Borde con IA reComputer RK3588-40

    reComputer RK3588-40

    Caja de Computación en el Borde con IA · NPU de 6 TOPS

    Caja de IA de código abierto con 8 núcleos + NPU de 6 TOPS, ampliable a 26 TOPS con un clic, para alojar localmente grandes modelos de lenguaje y servicios de inferencia multimodal: la base de cómputo donde aterrizan todas las capacidades de IA.

  • Terminal HMI con Pantalla Táctil reTerminal D1001

    reTerminal D1001

    HMI Táctil de 8 Pulgadas · Wi-Fi 6

    Un terminal HMI inteligente de 8 pulgadas basado en ESP32-P4, con cámara y doble micrófono, compatible con Wi-Fi 6 / BLE 5 / Zigbee / Matter: la interfaz principal para escenarios de interacción como guías en salas de exposición y recepción.

  • SenseCAP Watcher, Edición XiaoZhi

    SenseCAP Watcher ×2

    Dispositivo XiaoZhi de Interacción por Voz y Visión con IA

    Un terminal de IA que ve, escucha y habla; conectado a los modelos locales de gran tamaño actúa como «punto de servicio proactivo» del espacio — saluda a los visitantes cuando llegan y responde al instante a sus preguntas, demostrando el ciclo completo de interacción multimodal.

Los accesorios generales (pantalla, diseño de alimentación integrado, router, etc.) se configuran por separado.

Progresión en tres niveles: Demostración → Consultor → Diseño

L1 · Nivel de Demostración 1 días

Interacción de IA Sin Código

Nivel de Demostración · Experiencia de Punto Único

  • Experiencia Sin Código de Interacción de IA y Entrenamiento Visual
  • Conectar al Centro de Control Inteligente
  • Implementar Interacción Multimodal Básica
L2 · Nivel de Consultor 1 días

Backend de IA Local

Capa de consultoría · Escenas vinculadas

  • Desplegar Servicios de Backend de IA Localmente
  • Configurar Parámetros del Modelo
  • Conectar Librerías de Herramientas Existentes
L3 · Nivel de Diseño 1 días

Bucle de Negocio Privado

Nivel de Diseño · Integración de Negocio

  • Desplegar LLM Localmente
  • Desarrollar Herramientas Personalizadas
  • Implementar Bucle de Negocio Completamente Privado

Qué se lleva al terminar

No son demos sueltas, sino entregables que pueden encenderse en el momento, ser validados por el cliente y replicados por el equipo.

  • Experiencia de Interacción Multimodal Sin Código
  • Backend de IA Local y Conexión de Librerías de Herramientas
  • Ciclo cerrado de negocio totalmente privatizado

A quién va dirigido

Operaciones de Salas de Exposición y Turismo Cultural Proveedores de Soluciones de Comercio Minorista Inteligente Integradores de Servicios Espaciales Desarrollador de aplicaciones de IA

Combinaciones curriculares que incluyen este módulo

M2 Interacción de IA Multimodal

Colabora con Nosotros