Microsoft-Decision-1: el nuevo modelo de IA que toma decisiones
La IA ya no solo genera respuestas, también toma decisiones. Descubre Microsoft-Decision-1 y cómo puede transformar la automatización empresarial.
Microsoft acaba de presentar Microsoft-Decision-1, un nuevo modelo de inteligencia artificial diseñado para algo que, a primera vista, puede parecer mucho menos espectacular que generar textos, imágenes o código: tomar decisiones rápidas, precisas y económicas. Sin embargo, esta capacidad podría convertirse en una pieza fundamental para construir agentes de IA más eficientes, fiables y preparados para trabajar en entornos empresariales.
El anuncio, realizado el 9 de octubre de 2026, introduce una categoría de modelos que Microsoft quiere impulsar dentro de su plataforma Microsoft Foundry: los decision models o modelos de decisión. Su objetivo no es sustituir a los grandes modelos de lenguaje (LLM), sino complementarlos y evitar que tengamos que utilizar modelos generativos complejos para resolver operaciones relativamente sencillas.
Y es que, si lo pensamos, una parte importante del trabajo de un agente de IA no consiste en generar contenido, sino en decidir qué hacer a continuación. ¿Debe ejecutar una herramienta? ¿Qué departamento debería recibir una solicitud? ¿Es correcta una respuesta? ¿Hay suficiente confianza para continuar o necesitamos intervención humana?
Son decisiones que se repiten constantemente y que, cuando se multiplican por miles o millones de ejecuciones, tienen un impacto directo en el coste, la velocidad y la fiabilidad de cualquier solución de inteligencia artificial.
¿Qué es Microsoft-Decision-1 y en qué se diferencia de un LLM?
Microsoft-Decision-1 es un modelo especializado en evaluar situaciones y seleccionar respuestas entre un conjunto de opciones previamente definidas. A diferencia de modelos como GPT-6, que pueden generar contenido y resolver problemas complejos mediante razonamiento, Microsoft-Decision-1 está optimizado para proporcionar resultados estructurados que las aplicaciones puedan utilizar directamente.
Imaginemos un agente de atención al cliente que recibe un mensaje indicando que un usuario no puede acceder a su cuenta después de cambiar la contraseña. Un LLM podría interpretar el problema, generar una explicación, proponer soluciones y redactar una respuesta completa. Sin embargo, si únicamente necesitamos decidir a qué departamento debe enviarse la solicitud, probablemente no sea necesario recurrir a todas esas capacidades.
Microsoft-Decision-1 puede analizar el mensaje, evaluar opciones como soporte técnico, facturación o gestión de cuentas y determinar cuál es la más adecuada. Además, no se limita a seleccionar una categoría, sino que devuelve una puntuación de probabilidad para cada alternativa, lo que permite incorporar mecanismos de validación y control.
Esta diferencia es importante porque no todas las tareas de inteligencia artificial necesitan generación de lenguaje o razonamiento avanzado. Muchas aplicaciones empresariales funcionan mediante pequeñas decisiones sucesivas, y disponer de un modelo especializado para resolverlas permite diseñar arquitecturas mucho más eficientes.
Cómo funciona Microsoft-Decision-1
Para desarrollar Microsoft-Decision-1, Microsoft ha utilizado como base Qwen3.5-9B, un modelo de nueve mil millones de parámetros que ha sido sometido a un proceso de entrenamiento posterior (post-training) para especializarlo en decisiones estructuradas. La compañía también ha confirmado que tiene previsto desarrollar futuras versiones basadas en otros modelos, incluidos los de Microsoft AI (MAI) y OpenAI.
Su funcionamiento se basa en proporcionar al modelo una situación, una pregunta y un conjunto cerrado de respuestas posibles. El sistema evalúa las alternativas en una única pasada de inferencia y devuelve puntuaciones de probabilidad calibradas, evitando el proceso de generación secuencial de texto que caracteriza a los LLM tradicionales.
Entre los tipos de decisiones que admite encontramos preguntas de sí o no, selección múltiple, clasificaciones, escalas de valoración y evaluaciones basadas en rúbricas. También puede utilizarse para comprobar si una respuesta generada por otro modelo cumple determinados criterios o si una acción propuesta por un agente resulta apropiada.
Por ejemplo, podríamos configurar una evaluación con tres posibles resultados para una respuesta de un agente: aceptar, solicitar una revisión o escalar a una persona. A partir de las probabilidades devueltas por Microsoft-Decision-1, nuestra aplicación podría decidir qué camino seguir.
El modelo admite contextos de hasta 32.768 tokens, trabaja con entradas de texto y devuelve resultados estructurados en JSON. No está pensado para generar explicaciones, mantener conversaciones o resumir documentos, sino para actuar como un componente especializado dentro de aplicaciones y flujos de trabajo más amplios.
Microsoft-Decision-1 frente a los LLM: velocidad, precisión y estabilidad
Uno de los aspectos más interesantes del anuncio son los resultados de las pruebas realizadas por Microsoft. La compañía asegura que Microsoft-Decision-1 consigue un rendimiento superior al de diversos modelos generativos y modelos especializados de decisión cuando se evalúan tareas estructuradas.
Para comprobarlo, Microsoft ha realizado una evaluación con 36 benchmarks y cerca de 150.000 preguntas, utilizando conjuntos de pruebas que se habían mantenido fuera del entrenamiento del modelo. Los resultados publicados muestran un comportamiento especialmente competitivo en precisión, latencia, robustez y calibración de probabilidades.
Hasta 35 veces más rápido que GPT-6 Sol
Según las mediciones publicadas por Microsoft, Microsoft-Decision-1 presenta una latencia mediana (P50) aproximadamente 35 veces inferior a la de GPT-6 Sol en las tareas evaluadas. También resultó 2,5 veces más rápido que H2O-Lightning-4B v1.1, el segundo modelo más rápido en la comparación recogida en el anuncio.
Estas diferencias pueden resultar determinantes cuando hablamos de sistemas agénticos. Un agente que necesita realizar veinte decisiones consecutivas acumularía dos segundos adicionales de ejecución si cada una incorporase tan solo 100 milisegundos de latencia extra.
Ahora imaginemos ese mismo escenario en una plataforma empresarial que procesa miles de solicitudes por hora y utiliza distintos agentes para clasificar información, seleccionar herramientas, verificar respuestas y ejecutar procesos. Reducir la latencia de cada decisión no solo mejora la experiencia del usuario, sino que puede incrementar significativamente la capacidad operativa del sistema.
Eso sí, conviene interpretar las cifras correctamente. Son resultados de benchmarks publicados por Microsoft y no implican que Microsoft-Decision-1 sea 35 veces más rápido en cualquier aplicación o que supere a GPT-6 en tareas generales de generación y razonamiento.
Precisión que se mantiene en diferentes escenarios
Otro de los desafíos de los modelos especializados es conseguir que su rendimiento se mantenga cuando se enfrentan a situaciones diferentes de aquellas utilizadas durante el entrenamiento. Un modelo puede obtener resultados excelentes en una prueba concreta y funcionar mucho peor cuando cambian los datos, las instrucciones o el contexto de aplicación.
Microsoft ha evaluado Microsoft-Decision-1 en escenarios de clasificación, enrutamiento, ranking, razonamiento, seguridad, contexto largo y procesamiento multilingüe. También ha incluido pruebas con distribuciones de datos diferentes de las utilizadas durante el entrenamiento para comprobar su capacidad de generalización.
De acuerdo con los resultados publicados, el modelo obtuvo la mayor precisión global entre los sistemas comparados. Esto resulta especialmente interesante para las organizaciones que necesitan aplicar un mismo componente de IA en distintos procesos sin tener que entrenar un modelo específico para cada caso.
Robustez: que pequeños cambios no alteren una decisión
Hay un problema que no siempre recibe suficiente atención cuando diseñamos soluciones con IA: la consistencia de las decisiones. Si modificamos ligeramente una instrucción, cambiamos el orden de las opciones o reformulamos una descripción sin alterar su significado, lo razonable es esperar que el modelo mantenga su respuesta.
Microsoft sometió el modelo a ocho tipos de modificaciones sobre las mismas solicitudes para comprobar hasta qué punto cambiaban sus decisiones. El resultado fue una tasa media de cambios del 1,3 %, sin cambios detectados al reformular las descripciones de las opciones o al invertir y reorganizar su orden.
Esta estabilidad resulta especialmente relevante en automatizaciones empresariales donde los datos pueden llegar desde distintos sistemas, usuarios o aplicaciones. Un proceso de clasificación de incidencias, por ejemplo, debería identificar el mismo problema aunque el usuario utilice expresiones diferentes o el sistema cambie el orden de las categorías disponibles.
Probabilidades calibradas para automatizar con confianza
Una de las características que más me llaman la atención de Microsoft-Decision-1 es la importancia que concede a la calibración de probabilidades. No basta con que el modelo seleccione una respuesta; también interesa saber hasta qué punto podemos confiar en esa selección.
Un modelo bien calibrado debería acertar aproximadamente el 90 % de las veces en el conjunto de situaciones en las que asigna una probabilidad cercana al 90 %. Esta propiedad permite diseñar automatizaciones que no dependan únicamente de una respuesta, sino también del nivel de confianza asociado.
En un escenario empresarial podríamos establecer, por ejemplo, que determinadas decisiones se ejecuten automáticamente cuando la confianza supere un umbral definido. Las situaciones ambiguas podrían enviarse a un modelo más potente o solicitar una revisión humana, mientras que los casos claramente identificados continuarían sin intervención.
Estos umbrales deberían ajustarse mediante pruebas con datos reales. Una probabilidad alta no garantiza que una decisión sea correcta, y las consecuencias de un error deben formar parte del diseño de la automatización.
¿Qué está haciendo Microsoft con Decision-1 internamente?
Más allá de los benchmarks, Microsoft ha compartido algunos escenarios en los que distintos equipos están evaluando el modelo. Son ejemplos interesantes porque muestran que las decisiones estructuradas aparecen en procesos tan diferentes como la investigación de videojuegos, la evaluación de Copilot o el descubrimiento científico.
Xbox Research: analizar miles de opiniones de usuarios
El equipo de Xbox Research utilizó Microsoft-Decision-1 para procesar más de 10.000 comentarios abiertos procedentes de encuestas, Steam y X. El objetivo era clasificar las opiniones dentro de temas previamente definidos por los investigadores y comprender mejor qué decían los jugadores sobre lanzamientos, videojuegos y experiencias.
Según los resultados recogidos en el anuncio, el modelo consiguió una calidad competitiva frente a GPT-6 Sol, funcionando más de 14 veces más rápido y con un coste 200 veces inferior en ese escenario. La aplicación es especialmente interesante para equipos de marketing, investigación de mercado y experiencia de cliente que necesitan analizar grandes volúmenes de información cualitativa.
Copilot: evaluar la calidad de las respuestas
Los equipos de Copilot también han probado Microsoft-Decision-1 para evaluar la calidad de respuestas conversacionales y acciones de agentes. En esas pruebas, Microsoft afirma haber obtenido resultados competitivos respecto a GPT-5.6 Luna con una velocidad hasta 100 veces superior.
Este caso abre posibilidades para los sistemas de evaluación automatizada de IA. En lugar de utilizar siempre un modelo generativo de gran tamaño para comprobar el trabajo de otro modelo, podríamos incorporar un evaluador especializado que determine si una respuesta cumple una rúbrica previamente establecida.
Respuesta ante incidentes
Los ingenieros de Microsoft encargados de responder a incidentes necesitan localizar información relevante entre registros, tickets, comunicaciones y distintas fuentes internas. En sus pruebas, Microsoft-Decision-1 ofreció mejores resultados y menor latencia que un LLM para las tareas específicas de recuperación y selección de conocimiento evaluadas.
Aquí encontramos un escenario habitual en grandes organizaciones: localizar el documento, incidente anterior o procedimiento más relevante para resolver un problema. Una decisión rápida sobre qué información consultar puede mejorar el tiempo de respuesta sin necesidad de generar contenido adicional.
Microsoft Discovery: acelerar la investigación científica
Microsoft Discovery utiliza agentes que pueden evaluar los resultados de un experimento, revisar su estrategia y planificar nuevas acciones hasta alcanzar determinados objetivos. Este proceso de replanteamiento adaptativo requiere evaluar continuamente el trabajo realizado y decidir cómo continuar.
En las pruebas publicadas, Microsoft-Decision-1 obtuvo puntuaciones 46 veces más consistentes que las proporcionadas por la evaluación basada en un LLM, con una velocidad tres veces superior. Microsoft también observó que el proceso completo de replanteamiento adaptativo llegaba a ejecutarse casi cuatro veces más rápido.
El interés de este caso no se limita a la investigación científica. Cualquier proceso agéntico de larga duración que necesite evaluar resultados y ajustar sus siguientes pasos podría beneficiarse de mecanismos de decisión más rápidos y consistentes.
Casos de uso empresariales: dónde puede aportar valor Microsoft-Decision-1
Aunque Microsoft presenta numerosas posibilidades, creo que el verdadero potencial de Microsoft-Decision-1 aparece cuando lo situamos dentro de arquitecturas empresariales en las que ya existen aplicaciones, procesos y agentes de IA.
Especialmente interesante resulta su posible integración con escenarios construidos sobre Dynamics 365, Power Platform, Microsoft Copilot Studio y Microsoft Foundry. No hablamos necesariamente de una integración nativa disponible en todos estos productos, sino de arquitecturas que podrían utilizar el modelo a través de una API y conectarlo con procesos existentes.
Atención al cliente y Dynamics 365 Customer Service
Pensemos en una organización que recibe miles de solicitudes de atención al cliente y utiliza Dynamics 365 Customer Service para gestionar los casos. Antes de asignar cada solicitud, el sistema necesita identificar el motivo del contacto, determinar su prioridad y seleccionar el equipo más adecuado.
Microsoft-Decision-1 podría encargarse de esas clasificaciones mientras otros componentes gestionan las reglas de negocio, los datos del cliente y la ejecución de las acciones. Las solicitudes ambiguas o especialmente delicadas podrían derivarse a una revisión adicional, evitando que una clasificación incorrecta desencadene automáticamente un proceso sensible.
Agentes de Copilot Studio y selección de herramientas
En un agente desarrollado con Microsoft Copilot Studio pueden existir diferentes herramientas, agentes conectados y flujos de trabajo disponibles. Una de las decisiones recurrentes consiste en identificar qué componente debería utilizarse para atender una solicitud concreta.
Un modelo especializado podría actuar como mecanismo de enrutamiento y seleccionar la opción más apropiada entre un conjunto definido de herramientas o procesos. Esto permitiría explorar arquitecturas en las que un agente generativo se centre en comprender y resolver tareas complejas mientras las decisiones repetitivas se delegan a un componente más económico.
La integración requeriría desarrollarse y validarse, por ejemplo, mediante servicios intermedios o llamadas API. La disponibilidad de Microsoft-Decision-1 en Foundry no significa que todos los agentes de Copilot Studio puedan seleccionarlo directamente como modelo de decisión.
Power Automate y automatización de procesos
Power Automate permite automatizar procesos basados en reglas, condiciones y acciones. Sin embargo, existen situaciones en las que resulta difícil definir todas las reglas posibles porque las decisiones dependen de interpretar información no estructurada.
Microsoft-Decision-1 podría complementar estas automatizaciones clasificando solicitudes, validando determinados contenidos o proponiendo rutas de procesamiento. Power Automate seguiría siendo responsable de ejecutar los flujos y aplicar las reglas de negocio, mientras que el modelo ayudaría a resolver las decisiones que requieren interpretar lenguaje natural.
Por supuesto, cuando una decisión puede resolverse mediante una condición determinista sencilla, no tendría sentido sustituirla por una llamada a un modelo de IA. La optimización consiste en utilizar inteligencia artificial donde realmente aporta valor, no en incorporarla a todos los pasos del proceso.
Marketing, análisis de sentimiento y clasificación de contenidos
En marketing también encontramos aplicaciones muy interesantes. Desde clasificar comentarios de clientes y detectar intenciones comerciales hasta categorizar publicaciones, evaluar la relevancia de contenidos o priorizar oportunidades.
Por ejemplo, una empresa podría utilizar Microsoft-Decision-1 para clasificar miles de respuestas abiertas procedentes de encuestas de satisfacción según una taxonomía definida. Después, otras herramientas de análisis podrían identificar tendencias, representar resultados o generar informes ejecutivos a partir de esas clasificaciones.
Incluso en proyectos SEO podríamos explorar su utilización para clasificar consultas según su intención de búsqueda, evaluar la pertinencia temática de documentos o seleccionar contenidos candidatos para determinadas agrupaciones semánticas. Naturalmente, habría que validar su rendimiento frente a enfoques tradicionales, modelos de embeddings y otras alternativas de clasificación.
Seguridad, gobernanza y límites de Microsoft-Decision-1
La rapidez y el coste no son los únicos aspectos que debemos considerar cuando un modelo empieza a influir en las decisiones de una aplicación. Si una decisión implica ejecutar una herramienta, acceder a información sensible o modificar datos empresariales, necesitamos controlar cuidadosamente qué acciones están permitidas.
Microsoft ha evaluado Microsoft-Decision-1 con 5.250 solicitudes distribuidas en 11 benchmarks de seguridad que incluyen contenido perjudicial, intentos de jailbreak y ataques de inyección de instrucciones. La compañía afirma que el modelo consiguió rechazar comportamientos perjudiciales manteniendo un nivel elevado de utilidad, aunque estas pruebas no eliminan la necesidad de controles adicionales.
La documentación del modelo también establece limitaciones importantes. Microsoft-Decision-1 no está diseñado para actuar como único responsable de decisiones automatizadas de alto impacto sobre personas, como las relacionadas con empleo, crédito, vivienda, seguros, educación, salud o derechos legales.
Tampoco genera explicaciones sobre las decisiones tomadas, una limitación relevante para escenarios donde la trazabilidad y la justificación son necesarias. La aplicación que lo integra debe definir las opciones disponibles, los umbrales de confianza, las rutas de escalado y los mecanismos de supervisión humana.
Mi recomendación sería utilizarlo como componente de evaluación o apoyo a decisiones dentro de una arquitectura gobernada, nunca como sustituto de las autorizaciones, validaciones deterministas o controles de seguridad existentes. Especialmente cuando hablamos de agentes autónomos, una clasificación favorable no debería convertirse por sí sola en autorización para ejecutar cualquier acción.
Precio de Microsoft-Decision-1: una propuesta muy competitiva
Uno de los aspectos más llamativos del lanzamiento es su política de precios. Microsoft ha anunciado una tarifa de 0,042 dólares por cada millón de tokens de entrada, mientras que los tokens de salida no tienen coste adicional en el esquema publicado.
Este precio está claramente orientado a escenarios de alto volumen, en los que pueden ejecutarse millones de pequeñas decisiones. No obstante, el coste real de una solución también dependerá del número de solicitudes, los tokens utilizados, la infraestructura de integración, la supervisión y los demás modelos que participen en el proceso.
Para evaluar correctamente su impacto económico, deberíamos comparar el coste por decisión válida y no limitarnos al precio por token. Un modelo muy barato que genera demasiadas clasificaciones incorrectas puede terminar siendo más caro si obliga a ejecutar comprobaciones adicionales o provoca errores en los procesos empresariales.
Cómo empezar a utilizar Microsoft-Decision-1 en Microsoft Foundry
Microsoft-Decision-1 está disponible en el catálogo de modelos de Microsoft Foundry y también puede consultarse a través de OpenRouter. El anuncio de Microsoft Foundry Tech Community lo presenta como una versión preliminar pública (public preview), aunque la ficha del catálogo muestra un estado de ciclo de vida GA, por lo que conviene comprobar las condiciones aplicables al despliegue antes de incorporarlo a producción.
Para una primera prueba de concepto, comenzaría seleccionando un proceso con decisiones repetitivas, categorías bien definidas y un conjunto de ejemplos históricos cuya clasificación correcta conozcamos. Después compararía Microsoft-Decision-1 frente al sistema actual utilizando métricas de precisión, latencia, coste, calibración de confianza y porcentaje de casos que necesitan revisión humana.
Este enfoque permitiría determinar dónde realmente tiene sentido utilizar el modelo antes de introducirlo en procesos críticos.
¿Estamos ante una nueva capa de inteligencia artificial empresarial?
Durante los últimos años hemos prestado mucha atención a la capacidad de los modelos para generar respuestas cada vez más completas, razonar sobre problemas complejos y utilizar herramientas. Sin embargo, a medida que los agentes de IA empiezan a incorporarse a procesos reales de negocio, aparece una necesidad igual de importante: decidir de forma rápida, consistente y económica qué debe ocurrir en cada momento.
Microsoft-Decision-1 representa una apuesta por separar esas responsabilidades. En lugar de utilizar un único modelo de gran tamaño para comprender, generar, evaluar y tomar todas las decisiones, podemos construir sistemas en los que diferentes modelos se especialicen en distintas funciones.
Un LLM puede encargarse de interpretar una petición compleja o redactar una respuesta, un modelo de decisión puede evaluar si cumple determinados criterios y una aplicación empresarial puede ejecutar las acciones correspondientes bajo sus propias reglas de seguridad y gobernanza. Esta separación no solo puede reducir costes, sino también facilitar la evaluación de cada componente y el control de los procesos automatizados.
Desde mi punto de vista, el aspecto más interesante de Microsoft-Decision-1 no es que sea hasta 35 veces más rápido que un determinado LLM en un benchmark, sino el tipo de arquitectura que permite construir. Una arquitectura en la que dejamos de preguntarnos qué modelo de IA es el más potente y empezamos a preguntarnos qué modelo es el más adecuado para cada decisión.
Todavía será necesario comprobar cómo se comporta fuera de los benchmarks, especialmente en aplicaciones empresariales con datos reales, restricciones operativas y requisitos de seguridad exigentes. Pero el lanzamiento señala una evolución interesante del ecosistema de inteligencia artificial: pasar de aplicaciones que utilizan un único modelo para casi todo a sistemas compuestos por capacidades especializadas que colaboran entre sí.
Y quizá ahí esté una de las claves de la siguiente generación de agentes empresariales. No se trata simplemente de conseguir que la IA haga más cosas, sino de conseguir que tome mejores decisiones, más rápido y con un coste que permita escalar su utilización.
Información basada en las publicaciones: Introducing Microsoft-Decision-1, our model for fast decision-making, Introducing Microsoft-Decision-1 in Microsoft Foundry y Microsoft-Decision-1
