Evaluación de oportunidades y preparación
Analiza el trabajo, identifica cuellos de botella y evalúa los datos disponibles. Prioriza las oportunidades según su valor, viabilidad, riesgo y el esfuerzo necesario para cambiar el proceso.
Estrategia, software e ingeniería de IA
Conecta la decisión de negocio con la aplicación, los datos y la plataforma. Desarrolla capacidades útiles, comprende su comportamiento y mejóralas con pruebas.
Cómo medimos calidad, rendimiento y valorDecide dónde puede aportar valor la IA y qué necesitas para ponerla en marcha. Conecta el caso de negocio con la preparación de los datos, las decisiones técnicas y las personas que utilizarán el sistema.
Todas las especialidadesAnaliza el trabajo, identifica cuellos de botella y evalúa los datos disponibles. Prioriza las oportunidades según su valor, viabilidad, riesgo y el esfuerzo necesario para cambiar el proceso.
Compara la automatización convencional, los modelos predictivos y la IA generativa. Evalúa si conviene desarrollar o comprar, la dependencia de proveedores y el coste total, incluidos los datos, la integración, la evaluación y la operación continua.
Define una primera versión acotada y sus criterios de aceptación. Rediseña el flujo de trabajo con quienes lo utilizan, ofrece formación por perfiles y sigue la adopción, los comentarios y el soporte necesario para consolidar el cambio.
Acuerda quién se responsabiliza del producto, los datos, las decisiones de riesgo y el soporte. Establece una referencia inicial, asigna responsables de los beneficios y contrasta los resultados con el coste total. Utiliza esa información para continuar, ajustar o detener una iniciativa.
Diseña, desarrolla y moderniza aplicaciones web, APIs y sistemas de negocio. Combina diseño de producto, una arquitectura sólida y un desarrollo riguroso, tanto en IA como en software convencional.
Todas las especialidadesAnaliza las necesidades de los usuarios y el recorrido completo del servicio; después, contrasta las hipótesis con prototipos y estudios de usabilidad. Desarrolla interfaces accesibles y sistemas de diseño reutilizables. Define contenido, navegación, interacción por teclado y estados de carga, vacío y error junto con la implementación.
Define los límites del dominio, los modelos de datos y los contratos de API alrededor del negocio. Elige la arquitectura más sencilla que cumpla los requisitos, documenta las decisiones y adáptala al crecimiento del producto. Moderniza de forma gradual, con pruebas de compatibilidad y migraciones de datos ensayadas.
Mantén los cambios pequeños y revisables, con nombres claros, convenciones coherentes y refactorizaciones justificadas. Utiliza revisión entre compañeros, análisis estático y comprobaciones de dependencias para detectar problemas pronto. Integra validación de entradas, controles de acceso y gestión segura de secretos en el trabajo diario.
Utiliza desarrollo guiado por pruebas (TDD) para definir el comportamiento antes de implementarlo. Combina pruebas unitarias concretas con pruebas de integración y contratos, y verifica los recorridos críticos de extremo a extremo. Comprueba accesibilidad, rendimiento y seguridad según los requisitos acordados; reproduce los defectos en pruebas antes de corregirlos.
Automatiza las comprobaciones de compilación, pruebas y lanzamiento en CI/CD. Utiliza entornos reproducibles, infraestructura como código y despliegues graduales con un plan de recuperación. Acuerda objetivos de fiabilidad, supervisa errores y latencia, y mantén guías operativas, dependencias y documentación para que el equipo pueda operar el sistema tras la entrega.
Incorpora agentes y asistentes de programación al análisis, la implementación, las pruebas y el mantenimiento. Define el contexto del repositorio, los permisos y los criterios de revisión; después, compara plazos, defectos y retrabajo con una referencia inicial.
Convierte un proceso de negocio en un sistema capaz de razonar, utilizar herramientas y realizar trabajo útil. Define sus límites: qué sabe el agente, qué puede modificar y cuándo necesita a una persona.
Todas las especialidadesDiseña flujos de uno o varios agentes con estado persistente, memoria delimitada y puntos de control. Establece presupuestos de ejecución, reintentos y vías de recuperación para reanudar con seguridad las tareas largas.
Conecta herramientas mediante APIs y Model Context Protocol (MCP), y agentes independientes mediante Agent2Agent (A2A) cuando resulte útil. Valida las entradas, delimita los permisos y define contratos explícitos de delegación.
Separa el contexto de trabajo de la memoria persistente, resume las sesiones largas y carga las instrucciones pertinentes cuando se necesiten. Convierte los procedimientos repetibles en habilidades de agente versionadas, con alcance y revisión definidos.
Incorpora aprobaciones y vías de intervención en las acciones con consecuencias relevantes. Cuando no haya APIs, evalúa agentes que utilicen el navegador o el ordenador en entornos aislados, con acceso restringido y controles de recuperación.
Conecta las respuestas con las fuentes adecuadas. Combina búsqueda híbrida, grafos de conocimiento y recuperación mediante agentes según las preguntas, la estructura de los datos y el coste de mantenerlos.
Todas las especialidadesPrepara los documentos mediante ingesta, análisis, fragmentación y embeddings. Registra su procedencia, permisos de acceso, actualizaciones y eliminaciones para mantener la información recuperada útil y vigente.
Combina búsquedas por palabras clave y vectores, filtros de metadatos y reordenación de resultados. Añade contexto del documento a los fragmentos cuando mejore la recuperación y evalúa la reformulación de consultas y la relevancia con preguntas representativas.
Modela entidades y relaciones para conectar información entre fuentes. Utiliza recorridos del grafo y resúmenes de comunidades para preguntas sobre relaciones o sobre el conjunto de documentos, con resolución de entidades, trazabilidad y un plan de mantenimiento del grafo.
Permite que el sistema descomponga preguntas, elija fuentes y vuelva a buscar cuando falte información. Limita los pasos de búsqueda y el tamaño del contexto, conserva las citas y evita responder cuando las fuentes sean insuficientes.
Conecta preguntas en lenguaje natural con vistas de bases de datos autorizadas mediante text-to-SQL restringido. Valida las consultas y las definiciones de métricas, aplica controles de acceso y conserva la información resultante para su revisión.
Estos enfoques pueden combinarse. Los comparamos con tus preguntas y datos de origen, teniendo en cuenta la calidad de las respuestas, el tiempo de respuesta y el coste de mantener el sistema actualizado.
Elige el modelo y el grado de adaptación que necesita el problema. Compara modelos de lenguaje, métodos predictivos y referencias más sencillas con tus datos, restricciones y criterios de éxito.
Todas las especialidadesCompara modelos alojados y de pesos abiertos en tareas representativas. Desarrolla prompts versionados y salidas estructuradas; optimiza los prompts mediante evaluación y ajusta el presupuesto de razonamiento según calidad, latencia y coste.
Evalúa el ajuste fino supervisado, LoRA y la optimización de preferencias cuando los datos preparados justifiquen la adaptación. Valora la destilación y la cuantización para despliegues más pequeños, con pruebas de calidad sobre datos reservados, revisión de licencias y trazabilidad de los datos.
Desarrolla modelos de clasificación, previsión, recomendación y detección de anomalías. Utiliza referencias adecuadas, separa los datos de entrenamiento y evaluación, y considera la incertidumbre y el coste de una predicción incorrecta.
Trabaja con la información tal como llega: documentos, imágenes y audio. Conecta las salidas del modelo con datos estructurados, referencias a las fuentes y un proceso de revisión.
Todas las especialidadesCombina OCR, análisis de la estructura documental y modelos con capacidad visual para clasificar archivos y extraer información. Valida las salidas con esquemas y reglas de negocio.
Conecta reconocimiento de voz, comprensión del lenguaje y generación de voz. Diseña teniendo en cuenta la latencia, las interrupciones, el consentimiento y la transferencia a una persona, con evaluación en condiciones de grabación realistas.
Conserva las referencias a las fuentes, mide la exactitud de cada campo y deriva los resultados inciertos a personas. Prepara ejemplos etiquetados para la evaluación y valora los datos sintéticos antes de utilizarlos.
Lleva la IA a los sistemas que las personas ya utilizan. Conecta datos operativos, aplicaciones de negocio y canales de comunicación con contratos claros, permisos y vías de recuperación.
Todas las especialidadesConecta procesos de CRM, ERP, soporte y colaboración mediante APIs autorizadas. Las opciones de integración incluyen Salesforce, HubSpot, Microsoft 365, SharePoint, Google Workspace, Slack y Teams.
Conecta bases de datos SQL, almacenes analíticos, almacenamiento de objetos y bases vectoriales. Diseña procesos por lotes y en tiempo real, con captura de cambios cuando sea necesaria, trazabilidad, comprobaciones de vigencia y gestión de eliminaciones.
Diseña productos de datos reutilizables con responsables identificados, definiciones de negocio compartidas y expectativas de calidad. Moderniza el almacén de datos o lakehouse, documenta los contratos de datos y facilita la búsqueda de conjuntos autorizados mediante un catálogo.
Desarrolla APIs de servicio, webhooks, colas y servidores MCP. Utiliza identidades con permisos delimitados y OAuth cuando proceda, gestiona los secretos y garantiza reintentos seguros mediante idempotencia y gestión explícita de errores.
Desarrolla sobre AWS, Google Cloud o Microsoft Azure teniendo en cuenta tu infraestructura y requisitos operativos. Elige servicios de IA gestionados, contenedores o alojamiento privado según la carga de trabajo.
Todas las especialidadesEvalúa servicios de modelos gestionados, aplicaciones sin servidor, Kubernetes e inferencia dedicada. Planifica despliegues híbridos o locales cuando lo requieran los límites de los datos o la infraestructura existente.
Prepara entornos reproducibles con infraestructura como código, incluido Terraform. Diseña conjuntamente los límites de red, las identidades de las cargas de trabajo, los secretos, el cifrado y la ubicación regional.
Identifica dónde residen los datos, el procesamiento de modelos y los registros, incluidos los acuerdos de retención y acceso del proveedor. Evalúa despliegues privados, portabilidad y un plan de salida para que las decisiones tecnológicas sigan siendo compatibles con tus requisitos.
Planifica escalado, capacidad, recuperación y objetivos de servicio. Asigna costes por producto o equipo, establece presupuestos y utiliza la demanda medida para orientar la selección de recursos y las decisiones de FinOps.
Acceso gestionado a modelos, servicios de agentes y aprendizaje automático personalizado en tu entorno AWS.
Amazon Bedrock, Bedrock AgentCore y SageMaker AI.
Gemini y aprendizaje automático personalizado, conectados a tus datos y desplegados en servicios gestionados o contenedores.
Gemini Enterprise Agent Platform (la evolución de Vertex AI), Cloud Run y GKE.
Aplicaciones de IA y recuperación integradas con tus servicios de Azure y la identidad corporativa.
Microsoft Foundry, Azure AI Search y Microsoft Entra ID.
Crea una base para varias capacidades de IA sin que cada equipo tenga que resolver los mismos problemas operativos. Equilibra calidad, capacidad de respuesta y coste a partir de datos.
Todas las especialidadesUtiliza clasificación de intenciones o similitud entre embeddings para dirigir una petición al proceso, agente o fuente de conocimiento adecuados. Define umbrales de confianza y una alternativa para las peticiones ambiguas; aplica la autorización por separado.
Selecciona modelos según las necesidades de la tarea, la calidad medida, la latencia y el coste. Centraliza el acceso a proveedores, los límites de peticiones, los presupuestos y las alternativas ante fallos. Evalúa procesamiento por lotes, streaming, caché de prefijos y decodificación especulativa para la carga de inferencia.
Reutiliza respuestas a peticiones suficientemente similares solo cuando lo permitan el contexto, los permisos y la vigencia. Mide la reutilización incorrecta e invalida las entradas obsoletas. La caché de prefijos tiene otra función: reutilizar el cálculo de prefijos de prompts compartidos.
Versiona datos, prompts, modelos y configuración. Conecta los registros y la evaluación con CI/CD, despliegues graduales y reversión de cambios. Define criterios de supervisión y reentrenamiento para mantener los cambios reproducibles y revisables.
Define qué significa un buen resultado para tu aplicación y compara los cambios con una referencia reproducible. Evalúa tanto los componentes individuales como el recorrido completo del usuario.
Todas las especialidadesUtiliza puntuaciones de modelos con rúbricas explícitas, ejemplos de referencia y casos etiquetados por personas. Comprueba la concordancia de los evaluadores y revisa los desacuerdos antes de confiar en las puntuaciones.
Crea conjuntos de evaluación a partir de tareas representativas, casos límite y fallos observados. Reserva ejemplos independientes y ejecuta comprobaciones cuando cambien los prompts, los modelos o la recuperación.
Prueba tareas de varios turnos en entornos controlados, inspecciona el uso de herramientas y verifica el estado final del sistema. Repite los ensayos para comprender la variabilidad y comprueba recuperación, permisos y derivación ante fallos.
Compara configuraciones con los criterios de aceptación. Utiliza tráfico en paralelo o experimentos A/B controlados cuando proceda, junto con evaluación previa, revisión de muestras de producción y comentarios de usuarios.
Haz visible el comportamiento desde la primera petición hasta el resultado final. Ofrece a producto e ingeniería una visión compartida de la calidad, el rendimiento y las causas de los fallos.
Todas las especialidadesConecta en una traza las llamadas a modelos, la recuperación, la ejecución de herramientas y los pasos de los agentes, con información de versiones y ocultación adecuada de datos sensibles.
Crea paneles y alertas sobre resultados de tareas, evaluaciones, distribuciones de latencia, errores, consumo de tokens y costes.
Supervisa los cambios en los datos de entrada y en el comportamiento del modelo, segmenta los resultados por caso de uso e investiga las desviaciones. Incorpora los fallos revisados y los comentarios de usuarios a los conjuntos de evaluación y a las decisiones de reentrenamiento.
Convierte los requisitos de la organización en controles comprensibles y operables. Define responsabilidades, comportamientos permitidos y qué ocurre cuando algo falla.
Todas las especialidadesAplica controles de acceso al conocimiento, las herramientas y las interacciones con modelos. Diseña el aislamiento entre organizaciones, la retención de datos, la ocultación de información sensible y la gestión de secretos según lo que cada proceso necesita realmente.
Realiza pruebas adversariales de inyección de prompts, extracción de datos, contaminación de memoria y uso inseguro de herramientas. Combina validación de entradas y salidas con ejecución aislada, herramientas y dependencias autorizadas, y vías claras de escalado.
Mantén un inventario de modelos y usos, registra decisiones y aprobaciones, y define responsables de lanzamientos e incidentes. Apoya las revisiones de riesgo de la organización con pruebas trazables y documentación.
Evalúa el rendimiento en los grupos de usuarios pertinentes y documenta las limitaciones y la incertidumbre. Ofrece explicaciones adecuadas a la decisión y una vía práctica para cuestionar resultados o solicitar revisión humana.
Elegir las métricas adecuadas
Define el éxito de la tarea, establece una referencia inicial y elige métricas que ayuden al equipo a decidir. Estos son ejemplos entre los que seleccionar para cada aplicación.
¿La respuesta es útil y está respaldada por las fuentes?
Utiliza datos de referencia adecuados y revisión humana. La puntuación de un evaluador automático es una valoración que debe validarse, no una verdad de referencia.
¿El proceso completa la tarea prevista?
Interpreta los resultados en contexto: una transferencia a una persona en el momento adecuado puede ser el resultado correcto.
¿Cada petición llega al destino adecuado?
Comprueba peticiones ambiguas, contexto obsoleto y límites de permisos. Una tasa alta de aciertos no demuestra por sí sola un comportamiento correcto.
¿Las predicciones son útiles para la decisión?
Elige métricas según el coste de los errores. Considera el desequilibrio de clases, la validación temporal, las fugas de información y la deriva.
¿El sistema responde de forma fiable cuando se necesita?
Analiza las distribuciones y cada fase del proceso. Una media puede ocultar una mala experiencia para algunos usuarios.
¿El sistema aporta valor a un coste sostenible?
Evalúa el ahorro junto con la calidad y los resultados de las tareas. Una respuesta más barata solo es útil si sigue cumpliendo su función.