De Coding Agent a empleado digital: las aplicaciones de IA convergen en una única arquitectura de sistema
Del Coding Agent al Empleado Digital: La Aplicación de IA Está Convergiendo hacia una Misma Arquitectura de Sistema
Al recorrer los stands de varios productos Agent en la Conferencia de Yunqi, el hallazgo más contradictorio con la intuición es: aunque parecen pertenecer a industrias completamente diferentes, lo que emerge es el mismo conjunto de OS.
Qoder se dedica al desarrollo de software, QwenWork al trabajo del conocimiento, TinyFish al Web Browser Agent, WonderClip a la producción de video, y OpenSearch a la búsqueda e investigación.
Al eliminar las industrias específicas, su estructura subyacente converge altamente:
Contexto → Planificación → Habilidad → Ejecución → Verificación → Memoria → Resultado Comercial
Esta es la arquitectura de sistema única hacia la cual los productos Agent están convergiendo.
⚠ Este artículo toma como ejemplo de referencia el ecosistema de Alibaba Cloud (Qoder/QwenWork/TinyFish/WonderClip/OpenSearch). Sin embargo, los juicios arquitectónicos que se detallan a continuación son igualmente aplicables a plataformas de Agent en escenarios auto-construidos, Huawei Cloud, AWS, Azure y GCP — la pila de siete capas constituye una convergencia de estructura ingenieril, no una conclusión privativa de una nube específica.

1. El núcleo del Agent ha evolucionado de «responder» a «ejecutar de forma continua»
En la era del chatbot, el ciclo básico del sistema era muy sencillo: el usuario introduce datos, el modelo genera una respuesta.
En la era del Agent, las tareas pueden prolongarse durante minutos, horas o incluso más tiempo. El sistema necesita leer archivos, utilizar navegadores, invocar API, ejecutar código, esperar tareas asíncronas, verificar resultados, reintentar ante fallos y сохранять estado.
Un simple prompt junto con un modelo no puede asumir todas estas funciones.
El sistema debe empezar a contar con un Runtime.
慢慢学AI<035> | 从沙箱到工作台:AI Agent的产品形态演进
La tarea de Legal Document Fill Out que QwenWork demostró en su stand es bastante representativa: se ejecuta en un Sandbox Container independiente, donde el Agent cuenta con un escritorio virtual y puede invocar herramientas de procesamiento de documentos. La Marketing Content Generation complementa esto叠加 PPT, imágenes, Lip Sync, Python, Pillow, FFmpeg y otras herramientas diversas.
El entorno de ejecución del Agent se acerca cada vez más a una computadora programable: una unidad de trabajo protegida por sandbox, capaz de invocar múltiples runtimes y herramientas, y de ejecutar tareas de forma continua sin interrupciones. El Sandbox Container proporciona aislamiento, el escritorio virtual ofrece capacidades de operación visual con interfaz gráfica, y la invocación de herramientas permite que el modelo pase de “hablar” a “actuar”. Una vez que esta combinación se estabiliza, el Agent verdaderamente comienza a reemplazar la superficie operativa humana, no solo la superficie de pensamiento.
二、Qoder的”One Foundation”是一个产品信号,而非口号
En el stand de Qoder había una frase:
One workbench. Four entries. One foundation.
(原文即英文,无需翻译)
Arquitectura de Entrada Unificada para Agents
La capa superior alberga Workbench, CLI, IDE, JetBrains Plugin, y puede seguir expandiéndose con Cloud Agents y Agent SDK.
Sin embargo, lo verdaderamente值得关注的 es la capa Foundation compartida que se encuentra debajo.
Si cada punto de entrada implementara su propio Agent de forma independiente, el sistema perdería control rápidamente. El enfoque más sensato consiste en consolidar capacidades como scheduling de tareas, permisos, herramientas, Sandbox, Memory, Model Router y Verification en un Harness común.
Los puntos de entrada se encargan exclusivamente de adaptarse a distintos perfiles de usuario y escenarios: CLI para programadores, IDE para desarrolladores, Workbench para perfiles no técnicos, JetBrains para migración de código legacy, Cloud Agents para invocaciones asíncronas, y Agent SDK para integraciones de terceros. Debajo, el scheduling, la memoria, el gateway de herramientas, la verificación y el modelo de seguridad comparten la misma implementación.
El valor real de la reutilización es mucho mayor de lo que parece a simple vista
En una organización, la experiencia acumulada en el diseño de Sandbox para Coding Agents, en el diseño de Permission y en las estrategias de Recovery puede迁移se directamente a Browser Agents, Content Agents y Ops Agents. El coste más caro de “reinventar la rueda” no es el coste de desarrollo en sí, sino el desastre de gobernanza que surge cuando diferentes Agents se comportan de manera不一致 ante un problema: el mismo código puede modificarse tanto en el IDE Agent como en el CLI Agent, pero sus Permission Models son distintos, los formatos de los logs de auditoría no coinciden, y cuando ocurre un incidente, resulta imposible realizar un seguimiento.
Tres. Una Agent Stack genérica tiene al menos siete capas — y un mapa de inversión “construir / compartir / por validar” para cada una
Tras抽象ar el contenido de estos escenarios, he desglosado la Agent Stack en siete capas. La siguiente tabla también responde a la pregunta más práctica para cualquier organización: ¿qué capas conviene construir internamente, cuáles pueden compartirse directamente mediante código abierto o adquisición, y cuáles aún presentan incertidumbre?
| Nivel | Contenido | Evaluación de inversión (observación in situ 2026) |
|---|---|---|
| 1. Entry | Web / CLI / IDE / IM / API / GitHub Issue / consola empresarial | Capa de adaptación, no construir internamente — optar por el formato de entrada que mejor se adapte a los usuarios objetivo |
| 2. Task | Goal / Spec / Context / Acceptance / Priority / Budget | Construir internamente, pero ligero — es el contrato del task; si se define mal, todo lo posterior se complica |
| 3. Context & Memory | Conocimiento empresarial, conocimiento de código, historial de tareas, decisiones, preferencias de usuario, estado actual | Debe construirse internamente — el Context es un activo organizacional, no se puede comprar |
| 4. Planning & Skill | Descomposición de tareas, selección de Skill, selección de modelo, estrategia de paralelización | Skill construir internamente, Planning puede apoyarse en terceros — Skill es la barrera competitiva |
| 5. Runtime y Herramientas | Shell / Browser / Computer Use / Filesystem / Git / Database / MCP / API empresariales | Semi-construido — El Runtime general puede apoyarse en stacks open source como Browser Use, Anthropic Agent SDK, entre otros; el API gateway empresarial debe construirse internamente |
| 6. Verificación y Recuperación | Pruebas, verificación de reglas, evaluación de resultados, recuperación ante fallos, reintentos y rollback | Auto-construido — Las reglas de verificación están fuertemente vinculadas al negocio y no funcionan si se compran genéricamente |
| 7. Gobernanza | Permisos, Secrets, Auditoría, Costos, Políticas, Aprobación humana | Imprescindible auto-construido — Y debe diseñarse desde una perspectiva de ingeniería, no de cumplimiento normativo |
A continuación, desglosamos en una frase clave el juicio principal de cada una de las siete capas:
Primera capa: Entry (Punto de entrada). Ya sea Web, CLI, IDE, IM, API, Issue en GitHub o el portal corporativo — todos son meros canales de acceso a las tareas, y por sí mismos no generan valor de negocio.
Segundo nivel: Task. Goal, Spec, Context, Acceptance Criteria, Priority y Budget deberían formar parte integral de todo Task. Una descripción de Task sólida debe deixar claro: el objetivo, el motivo de su realización, los criterios para considerar que está completada, su prioridad y el presupuesto disponible. Si un sistema de Agent ni siquiera cuenta con estos seis campos, la tarea comenzará a flotar sin rumbo dentro del sistema.
Tercer nivel: Context & Memory. El conocimiento empresarial, el conocimiento del código, las tareas históricas, las decisiones tomadas, las preferencias de los usuarios y el estado actual residen en esta capa. Los conceptos que Qoder enfatiza en sus presentaciones —Repo Wiki, Knowledge Graph y Knowledge Cards— son manifestaciones concretas de este nivel: transformar “hechos dispersos” en “activos que la máquina puede recuperar”.
Cuarto nivel: Planning & Skill. El sistema evalúa cómo descomponer una tarea, selecciona qué Skill reutilizable aplicar, determina qué pasos requieren un modelo potente y cuáles pueden ejecutarse en paralelo. Esta capa es donde el Agent realmente comienza a “pensar”, y también donde se invocan densamente las capacidades del modelo.
Quinta capa: Runtime & Tools. Shell, Browser, Computer Use, Filesystem, Git, Database, MCP y APIs corporativas pertenecen a esta capa. Es la interfaz donde el Agent realmente se conecta con el mundo exterior.
Sexta capa: Verification & Recovery. Testing, verificación de reglas, evaluación de resultados, recuperación ante fallos, reintentos y rollbacks.
Séptima capa: Governance. Permisos, Secrets, Audit, Cost, Policy y Human Approval. Incluye también aspectos más detallados: registro algorítmico (算法备案), explicabilidad del modelo, atribución de errores, gestión de dependencias de terceros y control de transferencia de datos al extranjero (数据出境管控). Estas son varias restricciones estrictas inevitables para que las industrias altamente reguladas a nivel nacional (sanidad, finanzas, transporte, medios de comunicación, seguridad pública) puedan desplegar Agents en producción.
El modelo atraviesa todas las capas, pero ya no equivale a toda la plataforma de Agent. Este es el cambio de percepción más subestimado en los últimos dos años: muchos equipos han invertido demasiado tiempo comparando modelos, cuando lo que realmente determina si un sistema puede pasar a producción son las seis capas restantes.
Cuarta sección: Browser Agent complementa la interfaz entre el Agent y el mundo real
TinyFish es un producto muy representativo de esta categoría.
很多真实业务系统没有好用的 API,用户往往需要登录网站、操作动态页面、填写表单、切换标签页或下载文件。传统自动化依赖 Playwright 或 Puppeteer 脚本,一旦页面改版就会失效。Browser Agent 让模型能够直接理解网页结构并执行相应动作。
这项能力填补了 Agent Runtime 的一个重要缺口:真实 Web 场景。无论是外链提交 Agent、运营 Agent、采购 Agent 还是研究 Agent,都可能在网站中完成各种操作。
但真正的难点从来不在于”能不能点击按钮”。生产环境还需要解决一系列实际问题:登录态管理——Cookie 和 Token 如何维护、过期了怎么处理;并发控制——同一任务中多个标签页同时操作如何同步;故障恢复——页面崩溃或网络中断后如何继续执行;重复提交防护——网络抖动导致点击被重复执行如何避免;代理设置——地域或 IP 限制如何绕过;验证码处理——人机识别如何通过;权限隔离——多账号如何分开管理;以及最终如何”证明任务真的完成了”——即如何验证动作确实生效了。
更深一层,间接提示词注入(Indirect Prompt Injection) 是 Browser Agent 在 2026 年面临的最现实安全威胁:OWASP 将 prompt injection 列为 2026 年 AI 威胁之首,只需在页面中嵌入一段隐藏文本,就能诱导 Agent 将用户的 Cookie 发送出去。从架构层面来看,没有完整的解决方案,只能在 Sandbox、动作白名单和 Ambient Credential 控制方面做出工程上的折中。
Browser Use 也必须纳入 Harness 之中。仅仅具备 Demo 层的能力是远远不够的。如果一个组织真的要在大生产环境中部署 Browser Agent,光是这一层的成本就足以重新开发一整套 RPA 系统。
因此,Browser Agent 看起来像是应用,实际上却是 Runtime 的一部分。
五、Verification 决定了 Agent 能否获得更高权限
Agent 系统有一条非常直接的规律:自主性越高,验证和治理就必须越强。
一个只能起草邮件的 Agent,出错成本有限。
Un Agent capaz de modificar la base de datos de producción, enviar código, gestionar presupuestos publicitarios o manipular el back‑office empresarial conlleva un nivel de riesgo totalmente distinto.
Una plataforma de Agent verdaderamente madura no debe limitarse a responder qué puede hacer; debe dejar claro:
- Qué tiene permiso para acceder;
- Qué tiene permiso para modificar;
- Qué operaciones requieren aprobación;
- Qué registro de auditoría se deja en cada paso;
- Cómo se recupera tras un fallo;
- Cómo el sistema demuestra que la tarea se ha completado realmente.
Aquí se impone un criterio de ingeniería: si un Agent no puede proporcionar evidencia verificable para cada una de sus acciones, su autonomía debería quedar limitada al rol de «asesor». En otras palabras, la autonomía se amplía de forma gradual a medida que se verifican las capacidades dentro de un marco de cumplimiento, y no se desbloquea simplemente por listar funciones. Un Agent, aunque funcionalmente pueda invocar 100 API, si no puede demostrar que cada llamada ha alcanzado el resultado esperado, en escenarios de fuerte regulación como finanzas, sanidad o transferencia de datos transfronterizos, solo podrá mantenerse en el papel de «asesor».
Esta es también la razón por la que la Governance cobrará cada vez más importancia en los contextos empresariales: no es tarea exclusiva del departamento de cumplimiento, sino una capacidad que el equipo de ingeniería debe diseñar desde el inicio junto con el Runtime.

VI. Model Router se convertirán en programadores básicos de调度, pero no todos los niveles necesitan el modelo más costoso
Los modelos múltiples son cada vez más comunes.
Un sistema de modelos múltiples valioso no se limita a permitir que los usuarios seleccionen GPT, Qwen, Claude u otros modelos desde un menú desplegable.
Un enfoque más sensato es que el sistema enrute automáticamente según la tarea.
Las decisiones complejas de planificación y arquitectura utilizan modelos potentes; la implementación de código ordinaria y la organización de textos emplean modelos más económicos; las tareas visuales recurren a modelos multimodales; la clasificación por lotes se ejecuta con modelos rápidos; y las revisiones críticas vuelven a modelos potentes.
Detrás de esto hay un principio de ingeniería straightforward: diferentes tareas tienen requisitos completamente distintos en la curva de “capacidad-costo” de los modelos. Asignar un modelo potente a clasificación por lotes es un desperdicio; dejar que un modelo rápido tome decisiones arquitectónicas genera retrabajo constante. Requesty publicó en 2026 una cifra empirical: enrutar el 70% de las tareas rutinarias a modelos nano, el 20% a modelos de nivel medio y el 10% a modelos frontier puede reducir el costo promedio por consulta entre un 60% y un 80%, con una pérdida de calidad prácticamente nula — esto es una indicación direccional; los números específicos varían según el tipo de tarea y la estrategia de enrutamiento.
Los modelos se están transformando gradualmente en un recurso computacional programable. Agent Platform se encarga de la selección dinámica equilibrando calidad, velocidad, costo y riesgo.
Enrutamiento Escalonado en la Práctica: Un Ejemplo Real
Cuando un agente recibe la tarea de “analizar la estrategia de precios de la competencia y ofrecer recomendaciones”, utiliza un modelo potente durante la fase de “comprensión de la tarea, descomposición en pasos y determinación de prioridades”. Luego, al llegar a la etapa de “clasificar 100 SKU por rango de precio”, cambia a un modelo más rápido. Una vez obtenidos los resultados de la clasificación, vuelve a activar el modelo potente para realizar el juicio integrado.
Si se aplicara el modelo más costoso a todas las tareas, los costos del sistema se dispararían. Por otro lado, usar exclusivamente modelos baratos provocaría fracasos continuos en los nodos más complejos. El verdadero valor de la ingeniería reside en la estrategia de orquestación, no en la elección del modelo en sí.
Siete: Skills — La Capa Crítica que Conecta el Runtime Universal con el Negocio Vertical
Un Runtime de Agente universal, por sí solo, carece de valor de negocio.
Es a través de los Skills que accede a escenarios reales.
Coding Skill sabe cómo leer un repositorio, redactar especificaciones, ejecutar pruebas y generar pull requests. Define con precisión: cuándo es obligatorio ejecutar pruebas unitarias primero, cuándo se puede omitir una verificación, qué campos debe incluir la descripción del pull request, y qué cambios requieren revisión manual obligatoria.
SEO Research Skill domina el proceso completo de búsqueda de palabras clave, análisis de intención de búsqueda, verificación de competencia, generación de esquemas de contenido y confirmación de indexación. No se limita a “hacer investigación de palabras clave”: abarca un flujo de trabajo integral.
E-commerce Creative Skill conoce las marcas, SKU, formatos de plataforma, cumplimiento normativo y auditoría. Debe tener claro los límites de tamaño de imagen de cada plataforma, palabras prohibidas, requisitos de categoría y el último proceso de auditoría antes de la publicación.
Ops Skill sabe cómo consultar monitoreo, logs, contenedores, bases de datos y rollback. Debe poder distinguir qué alertas pueden responderse automáticamente, cuáles requieren intervención humana y cuál es el punto seguro de rollback.
Skill no es solo un SOP, sino también un activo ejecutable con gestión de versiones, gestión de dependencias, gestión de iteraciones y protección ante fallos. Se puede tomar como referencia el protocolo Skills lanzado por Anthropic en octubre de 2025, que empaqueta cada tipo de experiencia de dominio en carpetas SKILL.md, permitiendo que distintas plataformas de Agent lo carguen según necesidad, en lugar de reescribirlo cada vez.
Skill conecta la capacidad de ejecución genérica con el conocimiento del dominio.
Por lo tanto, la ventaja competitiva de muchas aplicaciones de IA en el futuro recaerá en los Domain Skills verificados con grandes cantidades de tareas reales. Estos Skills acumulan el saber hacer las cosas en ese dominio — no se ven fácilmente reemplazados por nuevos modelos ni por nuevas plataformas, sino que se benefician del interés compuesto a lo largo del tiempo.
Ocho perspectivas sectoriales: Formas concretas de implementación de IA en cuatro tipos de organizaciones
Los siguientes cuatro apartados no son narrativos, sino un mapeo de la «pila de siete capas» abstracta a sectores específicos, para identificar dónde radican los principales cuellos de botella en cada industria.
Telecomunicaciones/Operadoras: Los cambios de tarifas, la activación de servicios dedicados para empresas y la localización de fallos multi-dominio requieren atravesar múltiples sistemas: BSS, OSS, CRM y facturación. El dolor más agudo en la implementación de agentes es la conciliación inter-dominios: cuando un agente modifica una tarifa en el CRM, debe informar simultáneamente a los módulos de facturación y OSS; de lo contrario, los ciclos de facturación quedan desalineados. En la pila, las capas más valiosas son la quinta (Runtime & Tools, para integrar las interfaces multi-dominio) y la séptima (Governance, para auditorías contables).
Finanzas/Banca: La gestión de riesgos, la prevención del lavado de dinero, la conciliación y los informes regulatorios exigen todos ellos sistemas explicables, auditables y trazables. Un agente de prevención de lavado de dinero debe poder justificar cada “aprobación” o “bloqueo” indicando claramente qué regla aplicó, qué historial de transacciones consultó y qué información del cliente usó. En el Stack, las capas más valiosas son la 6 — Verification (cadena de evidencia explicable) — y la 7 — Governance (aprobación algorítmica + control de transferencia de datos transfronteriza) — porque bajo el marco regulatorio financiero nacional constituyen requisitos obligatorios para entrar en producción, no características opcionales.
Manufactura: Los sistemas MES, ERP, QMS y SRM llevan mucho tiempo aislados entre sí, y una decisión que abarca múltiples dominios — por ejemplo, “ante la insuficiencia de capacidad productiva, ¿se debe aumentar la compra de materiales?” — obliga a consultar cuatro sistemas distintos. En la práctica, el rol del agente en manufactura es funcionar como capa de orquestación transversal, no como sustituto de ningún sistema individual. Lee simultáneamente los materiales del ERP, las tasas de defecto del QMS, la utilización de capacidad del MES y el rendimiento de proveedores del SRM para formular un juicio integrado. En el Stack, las capas más valiosas son la 5 — Runtime (pasarela API empresarial) — y la 3 — Context (acumulación de conocimiento de procesos, histórico de averías y experiencia de planta).
Aprende IA poco a poco
E‑commerce: grandes eventos de venta cruzada (pedidos, pagos, inventario, logística, atención al cliente), pruebas de carga / consistencia de inventario / protección contra prácticas abusivas / reconciliación entre plataformas. El primer caso de uso del Agent en e‑commerce es la operación creativa (cambiar imágenes de producto, modificar fondos, generar material en varios idiomas) y la asistencia a los agentes de atención al cliente. En el Stack, las capas más valiosas son la 4 (Skill – procesos de cumplimiento y auditoría para cada SKU o canal) y la 6 (Verification – verificación automática de que el contenido cumple las normas de la plataforma).
Lo que tienen en común las cuatro organizaciones es que cuanto más bajo sea el nivel en el Stack, más conviene compartirlo; cuanto más alto, más vale la pena construirlo internamente. Las capacidades básicas como Runtime, Model Router y Tool Gateway son más rentables si se desarrollan conjuntamente entre varias empresas o se adquiere una solución open‑source consolidada; en cambio, Skill, Context y Governance deben construirse internamente, ya que están vinculadas al negocio, al cumplimiento normativo y a los activos de la organización.
9. Los productos finales pueden parecer muy distintos, pero comparten el mismo OS en su interior
Un Agent de codificación y un Agent de vídeo tienen interfaces de usuario, público objetivo y modelos de negocio completamente diferentes.
Sin embargo, en su interior ambos necesitan: Context, Task, Skill, Tools, Runtime, Verification, Memory y Governance; al final todo se traduce en resultados de negocio.
Un agente de conocimiento empresarial y un agente de navegación pueden parecer muy distintos, pero al final ambos tienen que resolver cuestiones de permisos, estados, recuperación ante fallos y auditoría.
Por lo tanto, al desarrollar múltiples productos de IA en el futuro, conviene distinguir dos capas.
La capa superior mantiene la especialización vertical. Cada producto gira en torno a un Job completo, con su propia experiencia de usuario, objetos de datos e indicadores de negocio. El objeto de un Coding Agent es el Repo y el Code Review; el de un agente de vídeo, el Script y el Asset; el de un agente de investigación, el Source y la Citation. La profundidad vertical de cada uno no puede sustituirse por capacidades genéricas.
La capa inferior se comparte en la medida de lo posible. El runtime del agente, el Model Router, el Tool Gateway, la memoria, la auditoría, los secrets y la evaluación pueden constituir infraestructura común.
Esto evita tanto que cada producto tenga que reinventar la rueda como construir desde el inicio una enorme «plataforma de agente universal» sin usuarios — este último ha sido un error que muchos equipos han cometido en los últimos dos años, intentando abordar todos los escenarios de una sola vez, con el resultado de que ninguno alcanzó una profundidad utilizable.
Implicaciones para los tomadores de decisiones
Si eres el responsable de IA en una empresa con ingresos anuales superiores a 5.000 millones de yuanes (CDO/CIO/CTO), hay tres acciones que puedes empezar a implementar ahora:
Un camino más sólido consiste en validar el valor a través de tareas específicas y, posteriormente, extraer las capacidades fundamentales que se repiten. El razonamiento detrás es el siguiente: la capa genérica solo puede crecer desde escenarios concretos, no desde un diagrama de arquitectura. Diseñar desde el inicio un Runtime que “soporte todos los escenarios” generalmente implica no haberlo hecho bien para ninguno de ellos.
Tres preguntas de autocontrol inverso (utilízalas como referencia una vez hayas terminado de escribir):
- ¿El Runtime que hemos abstractizado ha sido validado en al menos dos escenarios concretos para demostrar su通用性?
- ¿Cada una de nuestras decisiones de diseño en cada capa tiene detrás un problema de negocio real donde se materializó un error?
- Si hoy nos cortaran la mitad del presupuesto, ¿qué capas mantendríamos? Si la respuesta es “context y skill”, vas por buen camino; si es “runtime y gateway”, quizás debas volver al punto de partida.
Esta es también la impresión a largo plazo que me dejó la Cloud Ecosystem Conference (云栖大会, evento de Alibaba en Hangzhou): sobre los modelos está emergiendo una nueva capa de sistema que no pertenece exclusivamente a un producto en particular, sino que está convirtiéndose paulatinamente en el sistema operativo de la era de los Agent. Quien primero consolide esta capa de sistema operativo estará en mejor posición para capitalizar las oportunidades en la próxima iteración de productos.
慢慢学AI 003 | Siete capas del Agent Stack: mapa estratégico para implementar IA empresarial
Elabora un snapshot de las siete capas actuales del Agent Stack de tu organización — No te apresures a comprar productos; primero evalúa qué tienes en cada capa: vacío, soluciones externas o prototipos a medias. Este simple diagrama revelará los verdaderos cuellos de botella.
Selecciona 1 caso de alto ROI y cierra un bucle vertical completo primero — No empieces construyendo el Runtime. Elige entre Coding Agent, asistente de atención al cliente o asistente de I+D; integra las cuatro capas (Context, Task, Skill, Verification), y solo entonces hablemos de “construir una plataforma”.
Lleva la Governance al nivel de ingeniería, no al nivel de cumplimiento — Permisos, auditoría, explicabilidad, atribución de errores, gestión de dependencias de terceros: todo esto debe diseñarse junto con los Agent de negocio desde el inicio, no parchearse después.
Posibles preguntas
P1: ¿En qué se diferencian estas siete capas del framework de orquestación multi-Agent que proponen Gartner o IDC?
Gartner e IDC se centran en la coordinación y gobernanza de múltiples Agent a nivel organizacional; las siete capas aquí descritas son la estructura de ingeniería interna de un Agent individual. Una organización puede abordar ambos niveles simultáneamente: un Agent individual sigue las siete capas, mientras que la orquestación gestiona las interacciones entre múltiples Agent. El Stack es微观 (micro), la orquestación es宏观 (macro).
Q2: ¿Por qué la capa de modelos no ocupa una capa independiente?
Porque en un sistema de Agent, los modelos son recursos que atraviesan transversalmente toda la arquitectura, no una capa exclusiva. El Model Router gestiona distintos modelos como si fueran distintos recursos computacionales, situándolos al mismo nivel que Shell o Browser dentro del Runtime: son “herramientas” más. Que los modelos sean fundamentales es innegable, pero eso no significa que puedan acaparar toda la complejidad del Agent.
Q3: ¿Deberían los equipos pequeños saltarse esta capa y usar directamente productos de extremo a extremo como ChatGPT o Claude?
Sí. Para equipos con ingresos anuales inferiores a 100 millones de yuanes y baja complejidad organizativa, resulta mucho más rentable tirar de productos Agent ya готовых (Browser Use, Manus, Alibaba Cloud BaiLian Agent, etc.). Las siete capas que aquí se analizan nacen de una pregunta concreta: “¿Le interesa a una organización con ingresos anuales de más de 5.000 millones construir su propia plataforma de Agent?”. Para un equipo pequeño, meterse a construir plataforma es una optimización a la inversa.
Autocomprobación inversa (para ti, y también para mí)
Si al leer cualquiera de las tres afirmaciones siguientes asientes con la cabeza, cuidado: es posible que te estés dejando arrastrar por la narrativa de turno en lugar de razonar con datos:
- “Esta tecnología lo va a cambiar todo.”
- “Nadie puede permitirse quedarse fuera.”
- “Si no actúas ahora, llegarás tarde.”
Si alguna de esas frases te suena familiar y la aceptas sin más, probablemente estás tomando como verdad algo que aún no ha sido demostrado.
Tres mitos sobre Agents de IA que debes dejar de repetir
- “只要模型够强,Agent 就会自己工作。” → “Si el modelo es lo suficientemente potente, el Agent funcionará por sí solo.” (El modelo es condición necesaria, no suficiente. Los últimos seis niveles determinan si puede pasar a producción.)
- “我们需要一个万能 Agent 平台。” → “Necesitamos una plataforma de Agent universal.” (El costo de esta idea probablemente supera el valor de negocio que pueda generar en 6 meses.)
- “Skill 可以等模型稳定了再沉淀。” → “Los Skill pueden esperar a que el modelo se estabilice para consolidarse.” (Los Skill son activos organizacionales: cada día que se retrasa su consolidación es un día menos de interés compuesto.)
Si no reconoces ninguna de estas tres afirmaciones, continúa leyendo.
Nota sobre las referencias al final del artículo (procedencia de cada fuente + nivel de evidencia + indicación de posición)
«Un puesto de trabajo. Cuatro entradas. Una base.» — Panel y blog oficiales de Qoder, en la conferencia Yunqi 2026 + artículo Introducing Qoder 1.0 publicado en Alibaba Cloud Community el 31/08/2026. Nivel de evidencia: afirmación del proveedor (postura de Alibaba).
QwenWork Legal Document Fill Out: Sandbox Container + escritorio virtual + llamada de herramientas — Demo en vivo de QwenWork en Alibaba Cloud, artículo en Alibaba Cloud Community del 25/09/2026. Nivel de evidencia: afirmación del proveedor (postura de Alibaba).
QoderWake como producto de «empleado digital», lanzado por Alibaba el 30/04/2026 — Entrada de Qoder en la enciclopedia Baidu + la página oficial de Alibaba. Nivel de evidencia: afirmación del proveedor (postura de Alibaba).
La lista de amenazas OWASP 2026 sitúa Prompt Injection en primer lugar — Revisión de State of Browser Use, mayo de 2026 (blog de Michael Livs). Nivel de evidencia: compilación de terceros (postura de OWASP, consenso del sector).
Requesty: la distribución escalonada de rutas 70/20/10 puede reducir costos entre un 60‑80 % — Blog oficial de Requesty, 2026. Nivel de evidencia: afirmación del proveedor (perspectiva del servicio de enrutamiento de modelos, cifras optimistas, solo como orientación).
Microsoft Agent Governance Toolkit (AGT), código abierto bajo licencia MIT el 02‑04‑2026 — Noticia en niteagent.com. Nivel de evidencia: compilación de terceros (postura de Microsoft, pero AGT es un proyecto de código abierto con datos verificables).
Protocolo Anthropic Skills: publicado el 16/10/2025, código abierto como estándar abierto el 18/12/2025 ——Blog de ingeniería de Anthropic + síntesis de Substack + artículo de Medium LM Po. Nivel de evidencia: Afirmación del fabricante + síntesis de terceros (posición de Anthropic).
Predicción de IDC: en 2026, el 40% de los fabricantes implementarán programación impulsada por IA ——Revisión Groovy Web 2026, citando el informe de IDC. Nivel de evidencia: Síntesis de terceros (posición de IDC, referencia direccional de las cifras).
Stripe “Minions”: cada semana se fusionan más de 1.300 PR, cero líneas de código escritas, todo Review realizado por personas ——Equipo de ingeniería de Stripe, Steve Kaliski en el programa “How I AI” del 25/03/2026 + retransmisión de ByteMonk del 14/02/2026. Nivel de evidencia: Afirmación del fabricante (posición de Stripe; cifras de referencia; escenario interno de ingeniería de Stripe, no extrapolable al promedio del sector).
BCG 2026 Applied AI Index: el valor de la IA agentic representa el 22% (2026) → 39% (2030) del total de valor de IA — Informe públicamente disponible de BCG. Nivel de evidencia: síntesis de terceros (posición de firma consultora, referencia direccional).
Gartner predice que para 2026 el 40% de las aplicaciones empresariales incorporarán AI Agents de tareas, frente a menos del 5% en 2025 — Resumen de Paul Okhrem 2026, con referencia a Gartner. Nivel de evidencia: síntesis de terceros (posición de Gartner, referencia direccional).
CAC/NDRC/MIIT publican conjuntamente las «Disposiciones sobre la Estandarización de Aplicaciones y el Desarrollo Innovador de Agentes Inteligentes» (智能体标准化应用与创新发展实施意见), en vigor desde el 15 de julio de 2026 — Boletín mensual de regulación de IA en China, Rimon Law, julio 2026. Nivel de evidencia: síntesis de terceros (posición de firma jurídica, documento normativo verificable).
TinyFish: financiación de 47 M $, clientes como Google, DoorDash y Amazon, arranque en frío del navegador < 250 ms — Resumen de SwitchTools 2026. Nivel de evidencia: síntesis de terceros (posición de sitios de评测 de productos, cifras pendientes de verificación oficial en TinyFish).
Si estás evaluando cómo construir una plataforma de Agent empresarial interna, qué capacidades conviene desarrollar internamente frente a comprar o compartir, y qué Agent Runtime ofrece mayor valor de reutilización, no dudes en contactarnos. Somos especialistas en consultoría de transformación IA empresarial: desde la arquitectura de Agent y el diseño de Runtime hasta la consolidación de Skills,帮你把”单点 Agent”沉淀成”组织级 Agent 平台”. Te ayudamos a pasar de un «Agent puntual» a una «plataforma de Agent a nivel organizacional».
慢慢学AI:企业AI落地的关键策略
内部 Formación Empresarial
Enfocado en la dirección y el personal clave del negocio, este programa de 3 días tiene un costo de 90,000 ¥ por sesión. Desglosamos para tu equipo las siete capas del Agent Stack, la perspectiva de ingeniería de Governance y la metodología de acumulación de Skills.
Consultoría Especializada
Diagnóstico de arquitectura en 90 minutos desde 3,000 ¥. Proporcionamos una evaluación independiente del estado actual de las siete capas de tu organización, los niveles con brechas y un análisis de make vs. buy. Acompañamiento profundo con precios por proyecto.
Charlas Ejecutivas y Ponencias Sectoriales
Sesiones temáticas en conferencias del sector, reuniones a puertas cerradas o foros. Agenda personalizada tras contacto previo.
Correo de contacto: [email protected].
Lectura complementaria: Marco de siete pasos para la transformación con IA, que explica de forma sistemática la ruta completa para implementar IA en la empresa.
Puntos de localización (referencia multilingüe, acuerdo IAIUSE 2026-08-09)
Al traducir a 19 idiomas, reemplazar los siguientes elementos según la localización del mercado objetivo, manteniendo la estructura y presentación:
- Terminología regulatoria china: 等保测评/算法备案/数据出境评估/信创 → primera aparición con pinyin (explicación) o mapeo a equivalentes locales (UE: GDPR/NIS2; Japón: Ley de Protección de Datos Personales; EE.UU.: SOC 2/HIPAA)
- CAB → Change Advisory Board
- Productos chinos: Trae, Qoder, Tongyi Lingma (通义灵码), Wenxin Kuaima (文心快码), Comate, CodeGeeX, ByteDance
- Herramientas internacionales: Claude Code, Codex, Cursor, Copilot, Antigravity, Gemini, AWS Bedrock, Vertex AI
- Legislación china: 《网络安全法》(Ley de Seguridad Cibernética), 《数据安全法》 (Ley de Seguridad de Datos)
- Ejemplos sectoriales:运营商→AT&T/Verizon/NTT/KDDI/Deutsche Telekom/Telefónica/Vodafone; 银行→JP Morgan/Goldman Sachs/HSBC/BBVA/Santander; 制造→Siemens/Bosch/Toyota/General Motors; 电商→Amazon/eBay/Rakuten/MercadoLibre
- Datos numéricos: mantener cifras originales al 100%
- Título del blog: Learn AI Slowly (inglés), ゆっくり学ぶAI (japonés), остальные idiomas: “慢慢学AI” en pinyin o adaptación natural
慢慢学AI<001>
Tecnologías y productos mencionados
| Nombre del producto | Descripción |
|---|---|
| Qoder / QwenWork / TinyFish / WonderClip / OpenSearch | (Nombres de productos保留原名) |
Referencias adicionales
- Trae: Asistente de codificación de ByteDance
- 通义灵码 (Alibaba): Herramienta de codificación asistida por IA de Alibaba Cloud
- 文心快码 Comate: Herramienta de generación de código de Baidu
- CodeGeeX: Herramienta de codificación con IA de Zhipu AI
Nota: Este artículo forma parte de la serie 慢慢学AI (Aprende IA Lentamente), dirigida a profesionales de TI en los sectores de telecomunicaciones, finanzas, manufactura y comercio electrónico.
| 阿里云 / 钉钉 / 飞书 | Alibaba Cloud / AWS / GCP / Azure / Slack / Teams | アリババクラウド / AWS / GCP / Azure / Slack / Teams / Lark | Alibaba Cloud / AWS / GCP / Azure / Slack / Teams | علي بابا كلاود / AWS / Slack / Teams |
| 中国电信/移动/联通(企业 Agent 部署场景) | AT&T / Verizon / T-Mobile | NTT / KDDI / ソフトバンク | Deutsche Telekom / Vodafone | STC / Etisalat |
| 中国制造业代表企业(ERP/MES/QMS/SRM 案例) | GE / Honeywell / Rockwell | Toyota / Hitachi / NTT Data | Siemens / Bosch / SAP | SABIC / Aramco / STC |
| Banco de China (caso financiero) | JPMorgan / Goldman Sachs | Mitsubishi UFJ / SMFG | Deutsche Bank / Commerzbank | Emirates NBD / QNB |
|---|---|---|---|---|
| Sandbox Container / Escritorio virtual / Llamada a herramientas | Sandbox Container / Virtual Desktop / Tool Calling | サンドボックス / 仮想デスクトップ / ツール呼び出し | Sandbox-Container / Virtueller Desktop / Werkzeugaufruf | حاوية معزولة / سطح مكتب افتراضي / استدعاء الأدوات |
| One Foundation / Harness | One Foundation / Harness | One Foundation / Harness | One Foundation / Harness | One Foundation / Harness |
| Agente de navegador (浏览器智能体) | Browser Agent (保留) | ブラウザエージェント | Browser-Agent | وكيل المتصفح |
| Habilidad de Dominio / Habilidad de Programación / Habilidad de Investigación SEO / Habilidad Creativa de Comercio Electrónico / Habilidad de Operaciones |
| Model Router | Model Router (保留) | モデル路由器 | Model-Router | موجه النماذج |
| Verificación y Recuperación / Gobernanza | Verification & Recovery / Governance (保留) | 検証と復旧 / ガバナンス | Verifikation & Wiederherstellung / Governance | التحقق والاستعادة / الحوكمة |
| Registro de Algoritmos / Transferencia de Datos Transfronteriza | Algorithm Filing / Cross-border Data Transfer (保留) | アルゴリズム登記 / データ越境移転 | Algorithmus-Registrierung / grenzüberschreitende Datenübertragung | تسجيل الخوارزميات / نقل البيانات عبر الحدود |
Sobre esta serie
「云栖观察」 (Cloud Town Observation) es una serie de análisis de campo industrial lanzada por IAIUSE, tomando como punto de partida la Conferencia Yunqi 2026. Desde la perspectiva de un investigador, desglosa los cambios reales que están ocurriendo en la industria de la IA —sin perseguir titulares de moda, sino enfocándose únicamente en las direcciones apostadas y la solidez de la evidencia.
La serie abarca temas como la capa de sistemas por encima de los modelos, la implementación de Agents, los activos de Context, el diseño organizacional de IA empresarial y la migración de unidades competitivas en productos de IA, con un total de aproximadamente 10 entregas.
Con casi ocho años de experiencia en consultoría empresarial y análisis de negocio a gran escala, trabajé en IBM participando en proyectos de telecomunicaciones, finanzas, seguros y manufactura. Posteriormente, me desempeñé en primera línea desarrollando productos para operadores, aplicaciones de internet e IA, centrado en análisis de requerimientos, diseño de producto y ejecución transversal entre equipos. Detrás de este espacio hay en realidad un pequeño equipo: yo mismo junto con uno o dos colaboradores de largo plazo, cada uno encargado de áreas específicas como investigación sobre herramientas de programación con IA, análisis de casos de gobernanza organizacional y diálogos de coaching. La mayoría de los proyectos que mencionamos como “acompañamos a las empresas en su trayectoria” fueron ejecutados conjuntamente por nuestro equipo.
Nuestra base de investigación acumula más de 200 artículos. Los análisis presentados en esta serie se fundamentan en observaciones de campo y validación cruzada sectorial, manteniendo una postura claramente autoral y sin representar las posiciones de ningún proveedor tecnológico.





