Todo el sistema,
trabajando en conjunto.

Conecta la decisión de negocio con la aplicación, los datos y la plataforma. Desarrolla capacidades útiles, comprende su comportamiento y mejóralas con pruebas.

Cómo medimos calidad, rendimiento y valor

Estrategia y adopción de IA

Decide dónde puede aportar valor la IA y qué necesitas para ponerla en marcha. Conecta el caso de negocio con la preparación de los datos, las decisiones técnicas y las personas que utilizarán el sistema.

Todas las especialidades

Evaluación de oportunidades y preparación

Analiza el trabajo, identifica cuellos de botella y evalúa los datos disponibles. Prioriza las oportunidades según su valor, viabilidad, riesgo y el esfuerzo necesario para cambiar el proceso.

Decisiones tecnológicas y costes

Compara la automatización convencional, los modelos predictivos y la IA generativa. Evalúa si conviene desarrollar o comprar, la dependencia de proveedores y el coste total, incluidos los datos, la integración, la evaluación y la operación continua.

Hoja de ruta y adopción en la organización

Define una primera versión acotada y sus criterios de aceptación. Rediseña el flujo de trabajo con quienes lo utilizan, ofrece formación por perfiles y sigue la adopción, los comentarios y el soporte necesario para consolidar el cambio.

Modelo operativo y seguimiento del valor

Acuerda quién se responsabiliza del producto, los datos, las decisiones de riesgo y el soporte. Establece una referencia inicial, asigna responsables de los beneficios y contrasta los resultados con el coste total. Utiliza esa información para continuar, ajustar o detener una iniciativa.

Ingeniería de software y producto

Diseña, desarrolla y moderniza aplicaciones web, APIs y sistemas de negocio. Combina diseño de producto, una arquitectura sólida y un desarrollo riguroso, tanto en IA como en software convencional.

Todas las especialidades

Diseño de producto, servicio e interacción

Analiza las necesidades de los usuarios y el recorrido completo del servicio; después, contrasta las hipótesis con prototipos y estudios de usabilidad. Desarrolla interfaces accesibles y sistemas de diseño reutilizables. Define contenido, navegación, interacción por teclado y estados de carga, vacío y error junto con la implementación.

Arquitectura de aplicaciones y modernización

Define los límites del dominio, los modelos de datos y los contratos de API alrededor del negocio. Elige la arquitectura más sencilla que cumpla los requisitos, documenta las decisiones y adáptala al crecimiento del producto. Moderniza de forma gradual, con pruebas de compatibilidad y migraciones de datos ensayadas.

Calidad del código y desarrollo colaborativo

Mantén los cambios pequeños y revisables, con nombres claros, convenciones coherentes y refactorizaciones justificadas. Utiliza revisión entre compañeros, análisis estático y comprobaciones de dependencias para detectar problemas pronto. Integra validación de entradas, controles de acceso y gestión segura de secretos en el trabajo diario.

Desarrollo guiado por pruebas y garantía de calidad

Utiliza desarrollo guiado por pruebas (TDD) para definir el comportamiento antes de implementarlo. Combina pruebas unitarias concretas con pruebas de integración y contratos, y verifica los recorridos críticos de extremo a extremo. Comprueba accesibilidad, rendimiento y seguridad según los requisitos acordados; reproduce los defectos en pruebas antes de corregirlos.

Entrega continua y mantenimiento en producción

Automatiza las comprobaciones de compilación, pruebas y lanzamiento en CI/CD. Utiliza entornos reproducibles, infraestructura como código y despliegues graduales con un plan de recuperación. Acuerda objetivos de fiabilidad, supervisa errores y latencia, y mantén guías operativas, dependencias y documentación para que el equipo pueda operar el sistema tras la entrega.

Desarrollo de software asistido por IA

Incorpora agentes y asistentes de programación al análisis, la implementación, las pruebas y el mantenimiento. Define el contexto del repositorio, los permisos y los criterios de revisión; después, compara plazos, defectos y retrabajo con una referencia inicial.

Agentes y automatización de procesos

Convierte un proceso de negocio en un sistema capaz de razonar, utilizar herramientas y realizar trabajo útil. Define sus límites: qué sabe el agente, qué puede modificar y cuándo necesita a una persona.

Todas las especialidades

Orquestación y estado

Diseña flujos de uno o varios agentes con estado persistente, memoria delimitada y puntos de control. Establece presupuestos de ejecución, reintentos y vías de recuperación para reanudar con seguridad las tareas largas.

Uso de herramientas y coordinación de agentes

Conecta herramientas mediante APIs y Model Context Protocol (MCP), y agentes independientes mediante Agent2Agent (A2A) cuando resulte útil. Valida las entradas, delimita los permisos y define contratos explícitos de delegación.

Contexto, memoria y habilidades reutilizables

Separa el contexto de trabajo de la memoria persistente, resume las sesiones largas y carga las instrucciones pertinentes cuando se necesiten. Convierte los procedimientos repetibles en habilidades de agente versionadas, con alcance y revisión definidos.

Supervisión humana y ejecución controlada

Incorpora aprobaciones y vías de intervención en las acciones con consecuencias relevantes. Cuando no haya APIs, evalúa agentes que utilicen el navegador o el ordenador en entornos aislados, con acceso restringido y controles de recuperación.

RAG, grafos de conocimiento y búsqueda

Conecta las respuestas con las fuentes adecuadas. Combina búsqueda híbrida, grafos de conocimiento y recuperación mediante agentes según las preguntas, la estructura de los datos y el coste de mantenerlos.

Todas las especialidades

Procesamiento del conocimiento

Prepara los documentos mediante ingesta, análisis, fragmentación y embeddings. Registra su procedencia, permisos de acceso, actualizaciones y eliminaciones para mantener la información recuperada útil y vigente.

Recuperación híbrida y contextual

Combina búsquedas por palabras clave y vectores, filtros de metadatos y reordenación de resultados. Añade contexto del documento a los fragmentos cuando mejore la recuperación y evalúa la reformulación de consultas y la relevancia con preguntas representativas.

GraphRAG e ingeniería del conocimiento

Modela entidades y relaciones para conectar información entre fuentes. Utiliza recorridos del grafo y resúmenes de comunidades para preguntas sobre relaciones o sobre el conjunto de documentos, con resolución de entidades, trazabilidad y un plan de mantenimiento del grafo.

Recuperación mediante agentes y composición del contexto

Permite que el sistema descomponga preguntas, elija fuentes y vuelva a buscar cuando falte información. Limita los pasos de búsqueda y el tamaño del contexto, conserva las citas y evita responder cuando las fuentes sean insuficientes.

Datos estructurados y consultas analíticas

Conecta preguntas en lenguaje natural con vistas de bases de datos autorizadas mediante text-to-SQL restringido. Valida las consultas y las definiciones de métricas, aplica controles de acceso y conserva la información resultante para su revisión.

Elige la recuperación según la pregunta.

Estos enfoques pueden combinarse. Los comparamos con tus preguntas y datos de origen, teniendo en cuenta la calidad de las respuestas, el tiempo de respuesta y el coste de mantener el sistema actualizado.

Búsqueda híbrida y reordenación
Resulta útil paraEncontrar hechos y pasajes concretos entre documentos, incluidos términos exactos y coincidencias semánticas.
Qué evaluarRelevancia de la recuperación, contexto de los fragmentos y calidad de la ordenación. Una referencia útil para comparar enfoques más complejos.
GraphRAG
Resulta útil paraConectar entidades entre fuentes, seguir relaciones o resumir temas de una colección.
Qué evaluarCalidad del grafo, coste de extracción e indexación, reglas de acceso y esfuerzo para mantener actualizadas las relaciones.
Recuperación mediante agentes
Resulta útil paraPreguntas que requieren varias búsquedas, múltiples fuentes o una investigación adicional antes de poder responder.
Qué evaluarPresupuesto de pasos de búsqueda, latencia, cobertura de las fuentes y capacidad del sistema para saber cuándo detenerse.
Enfoques de contexto largo
Resulta útil paraTrabajar con un conjunto acotado de documentos relevantes que quepa en el contexto útil del modelo.
Qué evaluarAtención al detalle, límites del contexto, coste de tokens y vigencia. Comparar con la recuperación sobre las mismas tareas.

Selección de modelos y aprendizaje automático aplicado

Elige el modelo y el grado de adaptación que necesita el problema. Compara modelos de lenguaje, métodos predictivos y referencias más sencillas con tus datos, restricciones y criterios de éxito.

Todas las especialidades

Selección de modelos y diseño de prompts

Compara modelos alojados y de pesos abiertos en tareas representativas. Desarrolla prompts versionados y salidas estructuradas; optimiza los prompts mediante evaluación y ajusta el presupuesto de razonamiento según calidad, latencia y coste.

Ajuste fino y adaptación de modelos

Evalúa el ajuste fino supervisado, LoRA y la optimización de preferencias cuando los datos preparados justifiquen la adaptación. Valora la destilación y la cuantización para despliegues más pequeños, con pruebas de calidad sobre datos reservados, revisión de licencias y trazabilidad de los datos.

Predicción, clasificación por relevancia y apoyo a decisiones

Desarrolla modelos de clasificación, previsión, recomendación y detección de anomalías. Utiliza referencias adecuadas, separa los datos de entrenamiento y evaluación, y considera la incertidumbre y el coste de una predicción incorrecta.

Inteligencia documental, visual y de voz

Trabaja con la información tal como llega: documentos, imágenes y audio. Conecta las salidas del modelo con datos estructurados, referencias a las fuentes y un proceso de revisión.

Todas las especialidades

Análisis, extracción y clasificación

Combina OCR, análisis de la estructura documental y modelos con capacidad visual para clasificar archivos y extraer información. Valida las salidas con esquemas y reglas de negocio.

Experiencias de voz y audio

Conecta reconocimiento de voz, comprensión del lenguaje y generación de voz. Diseña teniendo en cuenta la latencia, las interrupciones, el consentimiento y la transferencia a una persona, con evaluación en condiciones de grabación realistas.

Calidad de datos y revisión

Conserva las referencias a las fuentes, mide la exactitud de cada campo y deriva los resultados inciertos a personas. Prepara ejemplos etiquetados para la evaluación y valora los datos sintéticos antes de utilizarlos.

Integración de sistemas de negocio y datos

Lleva la IA a los sistemas que las personas ya utilizan. Conecta datos operativos, aplicaciones de negocio y canales de comunicación con contratos claros, permisos y vías de recuperación.

Todas las especialidades

Aplicaciones empresariales y canales

Conecta procesos de CRM, ERP, soporte y colaboración mediante APIs autorizadas. Las opciones de integración incluyen Salesforce, HubSpot, Microsoft 365, SharePoint, Google Workspace, Slack y Teams.

Procesamiento y sincronización de datos

Conecta bases de datos SQL, almacenes analíticos, almacenamiento de objetos y bases vectoriales. Diseña procesos por lotes y en tiempo real, con captura de cambios cuando sea necesaria, trazabilidad, comprobaciones de vigencia y gestión de eliminaciones.

Bases de datos y responsabilidad

Diseña productos de datos reutilizables con responsables identificados, definiciones de negocio compartidas y expectativas de calidad. Moderniza el almacén de datos o lakehouse, documenta los contratos de datos y facilita la búsqueda de conjuntos autorizados mediante un catálogo.

APIs, eventos y MCP

Desarrolla APIs de servicio, webhooks, colas y servidores MCP. Utiliza identidades con permisos delimitados y OAuth cuando proceda, gestiona los secretos y garantiza reintentos seguros mediante idempotencia y gestión explícita de errores.

Arquitectura y despliegue en la nube

Desarrolla sobre AWS, Google Cloud o Microsoft Azure teniendo en cuenta tu infraestructura y requisitos operativos. Elige servicios de IA gestionados, contenedores o alojamiento privado según la carga de trabajo.

Todas las especialidades

Decisiones de arquitectura y despliegue

Evalúa servicios de modelos gestionados, aplicaciones sin servidor, Kubernetes e inferencia dedicada. Planifica despliegues híbridos o locales cuando lo requieran los límites de los datos o la infraestructura existente.

Infraestructura e identidad

Prepara entornos reproducibles con infraestructura como código, incluido Terraform. Diseña conjuntamente los límites de red, las identidades de las cargas de trabajo, los secretos, el cifrado y la ubicación regional.

Residencia de datos y elección de proveedores

Identifica dónde residen los datos, el procesamiento de modelos y los registros, incluidos los acuerdos de retención y acceso del proveedor. Evalúa despliegues privados, portabilidad y un plan de salida para que las decisiones tecnológicas sigan siendo compatibles con tus requisitos.

Fiabilidad y costes de la nube

Planifica escalado, capacidad, recuperación y objetivos de servicio. Asigna costes por producto o equipo, establece presupuestos y utiliza la demanda medida para orientar la selección de recursos y las decisiones de FinOps.

AWS

Acceso gestionado a modelos, servicios de agentes y aprendizaje automático personalizado en tu entorno AWS.

Amazon Bedrock, Bedrock AgentCore y SageMaker AI.

Google Cloud

Gemini y aprendizaje automático personalizado, conectados a tus datos y desplegados en servicios gestionados o contenedores.

Gemini Enterprise Agent Platform (la evolución de Vertex AI), Cloud Run y GKE.

Microsoft Azure

Aplicaciones de IA y recuperación integradas con tus servicios de Azure y la identidad corporativa.

Microsoft Foundry, Azure AI Search y Microsoft Entra ID.

Plataformas de IA, enrutamiento y optimización

Crea una base para varias capacidades de IA sin que cada equipo tenga que resolver los mismos problemas operativos. Equilibra calidad, capacidad de respuesta y coste a partir de datos.

Todas las especialidades

Enrutamiento semántico

Utiliza clasificación de intenciones o similitud entre embeddings para dirigir una petición al proceso, agente o fuente de conocimiento adecuados. Define umbrales de confianza y una alternativa para las peticiones ambiguas; aplica la autorización por separado.

Pasarelas de modelos e inferencia

Selecciona modelos según las necesidades de la tarea, la calidad medida, la latencia y el coste. Centraliza el acceso a proveedores, los límites de peticiones, los presupuestos y las alternativas ante fallos. Evalúa procesamiento por lotes, streaming, caché de prefijos y decodificación especulativa para la carga de inferencia.

Caché semántica

Reutiliza respuestas a peticiones suficientemente similares solo cuando lo permitan el contexto, los permisos y la vigencia. Mide la reutilización incorrecta e invalida las entradas obsoletas. La caché de prefijos tiene otra función: reutilizar el cálculo de prefijos de prompts compartidos.

MLOps y LLMOps

Versiona datos, prompts, modelos y configuración. Conecta los registros y la evaluación con CI/CD, despliegues graduales y reversión de cambios. Define criterios de supervisión y reentrenamiento para mantener los cambios reproducibles y revisables.

Evaluación y experimentación

Define qué significa un buen resultado para tu aplicación y compara los cambios con una referencia reproducible. Evalúa tanto los componentes individuales como el recorrido completo del usuario.

Todas las especialidades

LLM como evaluador y calibración humana

Utiliza puntuaciones de modelos con rúbricas explícitas, ejemplos de referencia y casos etiquetados por personas. Comprueba la concordancia de los evaluadores y revisa los desacuerdos antes de confiar en las puntuaciones.

Conjuntos de datos y pruebas de regresión

Crea conjuntos de evaluación a partir de tareas representativas, casos límite y fallos observados. Reserva ejemplos independientes y ejecuta comprobaciones cuando cambien los prompts, los modelos o la recuperación.

Simulaciones de agentes y verificación de resultados

Prueba tareas de varios turnos en entornos controlados, inspecciona el uso de herramientas y verifica el estado final del sistema. Repite los ensayos para comprender la variabilidad y comprueba recuperación, permisos y derivación ante fallos.

Experimentos y decisiones de lanzamiento

Compara configuraciones con los criterios de aceptación. Utiliza tráfico en paralelo o experimentos A/B controlados cuando proceda, junto con evaluación previa, revisión de muestras de producción y comentarios de usuarios.

Observabilidad y métricas útiles

Haz visible el comportamiento desde la primera petición hasta el resultado final. Ofrece a producto e ingeniería una visión compartida de la calidad, el rendimiento y las causas de los fallos.

Todas las especialidades

Trazabilidad de todo el sistema

Conecta en una traza las llamadas a modelos, la recuperación, la ejecución de herramientas y los pasos de los agentes, con información de versiones y ocultación adecuada de datos sensibles.

Supervisión de calidad y operación

Crea paneles y alertas sobre resultados de tareas, evaluaciones, distribuciones de latencia, errores, consumo de tokens y costes.

Información que mejora el producto

Supervisa los cambios en los datos de entrada y en el comportamiento del modelo, segmenta los resultados por caso de uso e investiga las desviaciones. Incorpora los fallos revisados y los comentarios de usuarios a los conjuntos de evaluación y a las decisiones de reentrenamiento.

Seguridad, IA responsable y gobierno

Convierte los requisitos de la organización en controles comprensibles y operables. Define responsabilidades, comportamientos permitidos y qué ocurre cuando algo falla.

Todas las especialidades

Permisos y límites de los datos

Aplica controles de acceso al conocimiento, las herramientas y las interacciones con modelos. Diseña el aislamiento entre organizaciones, la retención de datos, la ocultación de información sensible y la gestión de secretos según lo que cada proceso necesita realmente.

Controles de seguridad y pruebas adversariales

Realiza pruebas adversariales de inyección de prompts, extracción de datos, contaminación de memoria y uso inseguro de herramientas. Combina validación de entradas y salidas con ejecución aislada, herramientas y dependencias autorizadas, y vías claras de escalado.

Auditabilidad y responsabilidad

Mantén un inventario de modelos y usos, registra decisiones y aprobaciones, y define responsables de lanzamientos e incidentes. Apoya las revisiones de riesgo de la organización con pruebas trazables y documentación.

Equidad, explicabilidad y revisión humana

Evalúa el rendimiento en los grupos de usuarios pertinentes y documenta las limitaciones y la incertidumbre. Ofrece explicaciones adecuadas a la decisión y una vía práctica para cuestionar resultados o solicitar revisión humana.

Métricas que responden
preguntas útiles.

Define el éxito de la tarea, establece una referencia inicial y elige métricas que ayuden al equipo a decidir. Estos son ejemplos entre los que seleccionar para cada aplicación.

Calidad de respuestas y recuperación

¿La respuesta es útil y está respaldada por las fuentes?

Ejemplos de métricas
Relevancia de la respuesta, fidelidad a las fuentes, exactitud de las citas, precisión y exhaustividad de la recuperación.

Utiliza datos de referencia adecuados y revisión humana. La puntuación de un evaluador automático es una valoración que debe validarse, no una verdad de referencia.

Eficacia de los agentes

¿El proceso completa la tarea prevista?

Ejemplos de métricas
Finalización verificada de tareas, uso correcto de herramientas, consistencia entre ejecuciones, derivación a personas y resultados de las aprobaciones.

Interpreta los resultados en contexto: una transferencia a una persona en el momento adecuado puede ser el resultado correcto.

Corrección del enrutamiento y la caché

¿Cada petición llega al destino adecuado?

Ejemplos de métricas
Exactitud al clasificar intenciones, frecuencia de alternativas, tasa de aciertos válidos de caché y reutilización incorrecta de respuestas.

Comprueba peticiones ambiguas, contexto obsoleto y límites de permisos. Una tasa alta de aciertos no demuestra por sí sola un comportamiento correcto.

Rendimiento predictivo

¿Las predicciones son útiles para la decisión?

Ejemplos de métricas
Precisión y exhaustividad, calibración de probabilidades, error de previsión y calidad de la ordenación.

Elige métricas según el coste de los errores. Considera el desequilibrio de clases, la validación temporal, las fugas de información y la deriva.

Velocidad y fiabilidad

¿El sistema responde de forma fiable cuando se necesita?

Ejemplos de métricas
Tiempo hasta el primer token, latencia total p50 y p95, capacidad de procesamiento, tiempos de espera agotados y tasas de error.

Analiza las distribuciones y cada fase del proceso. Una media puede ocultar una mala experiencia para algunos usuarios.

Coste y valor del producto

¿El sistema aporta valor a un coste sostenible?

Ejemplos de métricas
Coste por tarea completada, coste operativo total, adopción, tiempo ahorrado tras revisar y corregir, y avance hacia el resultado de negocio acordado.

Evalúa el ahorro junto con la calidad y los resultados de las tareas. Una respuesta más barata solo es útil si sigue cumpliendo su función.