Perplexity y NVIDIA quieren sacar los agentes de IA de la nube

Perplexity y NVIDIA quieren sacar los agentes de IA de la nube

Descubre cómo Portable Computer de Perplexity y NVIDIA lleva los agentes de IA al hardware local, combina privacidad, menor coste y acceso híbrido a la nube.

Hasta ahora hemos hablado mucho del precio de los tokens.

Cuánto cuesta un millón de tokens de entrada. Cuánto cuestan los de salida. Qué modelo ofrece mejor relación entre inteligencia, velocidad y precio.

Pero Perplexity y NVIDIA están planteando una pregunta bastante más incómoda:

¿Y si dejamos de pagar por cada token? Perplexity acaba de presentar Portable Computer, una versión de su plataforma de agentes Computer diseñada para ejecutar modelos, herramientas, archivos y buena parte de la orquestación directamente sobre hardware propiedad del usuario.

La propuesta debuta sobre NVIDIA DGX Spark y nace de una colaboración directa entre Perplexity y NVIDIA. El trabajo realizado completamente en local no consume créditos de Perplexity y los datos pueden permanecer dentro de la máquina. Cuando el agente necesita capacidades adicionales —Internet, aplicaciones conectadas o un modelo frontier— puede escalar determinados pasos a la nube con autorización del usuario.

Pero creo que quedarse en “Perplexity ahora funciona en local” sería perderse lo realmente interesante. Portable Computer puede ser una señal de hacia dónde se dirige la arquitectura económica de los agentes de IA. Porque un agente no consume inteligencia igual que un chatbot. Y esa diferencia puede cambiarlo todo.

El problema ya no es ejecutar un modelo local

Ejecutar un LLM en nuestro ordenador no es especialmente novedoso.

Tenemos Ollama, LM Studio, vLLM y multitud de modelos abiertos que podemos descargar y ejecutar sobre nuestras propias GPUs.

Portable Computer intenta resolver otro problema.

Perplexity está empaquetando no solamente el modelo, sino también gran parte de la infraestructura necesaria para convertir ese modelo en un agente capaz de trabajar.

Dentro del dispositivo pueden ejecutarse componentes como el planner, el orquestador, el router de herramientas, el scheduler, la cola persistente de tareas y el índice de búsqueda local. También incluye mecanismos para trabajar con archivos, ejecutar herramientas y código dentro de entornos aislados.

Dicho de otra forma: Ollama te ayuda a ejecutar un modelo. Portable Computer quiere ayudarte a ejecutar un trabajador digital.

La diferencia parece pequeña, pero técnicamente es enorme.

Cuando intentamos construir un agente local por nuestra cuenta empiezan a aparecer muchas piezas:

  • modelo;
  • servidor de inferencia;
  • agent harness;
  • herramientas;
  • memoria;
  • conectores;
  • gestión del contexto;
  • permisos;
  • sandbox;
  • planificación;
  • reintentos;
  • observabilidad;
  • y mecanismos para decidir cuándo utilizar otro modelo.

Perplexity intenta convertir todo eso en algo mucho más parecido a instalar una aplicación.

Y esa experiencia “appliance-like” puede ser tan importante como los propios modelos.

Ollama no es realmente el competidor

Durante la presentación de Portable Computer surgió precisamente la comparación con Ollama.

La respuesta de Perplexity es interesante porque delimita perfectamente las dos categorías.

Portable Computer utiliza vLLM para servir la inferencia debajo de la aplicación y permite incluso configurar endpoints propios en modos avanzados. Pero, según Perplexity, la mayor parte del trabajo diferencial está en el agent harness y en haber optimizado conjuntamente modelo, herramientas y sistema de orquestación.

Esto tiene bastante sentido. Poner un LLM detrás de una API es relativamente fácil. Conseguir que ese modelo:

  • entienda una tarea compleja,
  • divida el trabajo,
  • encuentre los archivos adecuados,
  • utilice herramientas,
  • no destruya accidentalmente nuestro sistema,
  • mantenga el contexto,
  • compruebe sus propios resultados,
  • se recupere de errores
  • y sepa cuándo pedir ayuda a un modelo más potente

es otra historia completamente diferente.

NVIDIA lo describió durante el briefing con una metáfora bastante acertada: montar inferencia local es relativamente sencillo, pero cuanto más profundamente entras en sistemas agentic, más modelos, rendimiento, harnesses y componentes necesitas.

El problema de la IA local está dejando de ser “¿puedo ejecutar este modelo?” para convertirse en “¿puedo construir un sistema útil alrededor de este modelo?”.

Y ahí está precisamente la apuesta de Perplexity.

El verdadero motivo para ejecutar agentes en local: los tokens

Aquí empieza la parte que me parece más importante. Los chatbots y los agentes tienen patrones de consumo completamente diferentes.

Un chatbot funciona más o menos así: pregunta → respuesta → fin.

Podemos mantener conversaciones largas, evidentemente, pero la interacción continúa siendo relativamente discreta.

Los agentes cambian ese modelo. Un agente puede pasar una hora:

  • analizando 200 documentos,
  • ejecutando código,
  • leyendo resultados,
  • consultando diferentes fuentes,
  • corrigiéndose,
  • volviendo a ejecutar una tarea,
  • verificando sus conclusiones
  • y generando finalmente un informe.
  • Incluso puede quedarse activo durante toda la noche.

NVIDIA habla explícitamente de agentes 24×7 y posiciona DGX Spark como una máquina adecuada para cargas autónomas de larga duración.

Y eso produce una consecuencia económica muy sencilla: los agentes tienen hambre de tokens. Muchísima hambre.

Cuando cada ciclo de razonamiento se ejecuta contra una API cloud, cada uno de esos pasos tiene precio.

Cuando la inferencia se ejecuta sobre una GPU que ya poseemos, dejamos de pagar una tarifa por cada token procesado.

No significa que la IA sea gratis. Existe el coste del hardware. Existe la electricidad. Existe mantenimiento. Existe depreciación.

Pero desaparece una parte fundamental de la ecuación: el coste marginal por token de la API.

Perplexity confirma que las tareas realizadas completamente en el dispositivo no consumen créditos de Computer.

Esta diferencia puede parecer pequeña cuando hablamos con un chatbot durante diez minutos.

Puede ser enorme cuando desplegamos cientos de agentes trabajando millones o miles de millones de tokens.

De “tokens por dólar” a capacidad instalada

Esto cambia también la forma de entender el hardware.

Hasta ahora comprábamos una GPU pensando principalmente en capacidad:

  • ¿Cuántos parámetros puedo cargar?
  • ¿Cuántos tokens por segundo puedo generar?
  • ¿Cuánta memoria necesito?

Los agentes introducen otro cálculo. ¿Cuánta inteligencia puedo producir con este activo durante los próximos tres años?

Imaginemos una empresa comprando una máquina dedicada por 5.000 euros. La pregunta ya no debería ser únicamente si puede ejecutar un determinado modelo. La pregunta podría ser:

  • ¿Cuánto trabajo agentic podrá procesar durante tres años frente a pagar ese mismo volumen mediante APIs?

En ese momento, GPUs y equipos como DGX Spark empiezan a parecerse menos a un ordenador personal y más a CAPEX para producir inteligencia.

Y creo que esta idea merece bastante atención.

Durante años hemos consumido inteligencia artificial principalmente como OPEX:

  • pago por API,
  • pago por token,
  • pago por usuario,
  • pago por crédito.

La IA local introduce nuevamente una alternativa: comprar capacidad de cómputo y amortizarla.

El modelo más interesante probablemente no sea 100% local

Ahora bien, tampoco creo que la conclusión sea que todo debe ejecutarse en nuestro ordenador.

Los propios datos publicados alrededor de Portable Computer muestran justamente lo contrario.

La arquitectura más interesante puede ser híbrida.

Perplexity ha evaluado este concepto sobre Terminal-Bench 2.1, un benchmark diseñado para medir agentes capaces de resolver tareas reales en entornos de terminal. Terminal-Bench 2.1 contiene 89 tareas después de la revisión publicada en mayo de 2026.

Según los resultados publicados por Perplexity:

ArquitecturaResultadoCoste estimado por tarea
Qwen local59,6%≈ $0 marginal de API
Qwen local + Claude Opus 5 como advisor73,0%$0,415
Claude Opus 582,4%$0,65

Estos números hay que interpretarlos con cautela porque proceden de las propias evaluaciones de Perplexity.

Pero el patrón es tremendamente interesante. El modelo local obtiene 59,6%. Cuando puede pedir ayuda puntualmente a Claude Opus 5, sube al 73%.

Es decir, recupera aproximadamente el 59% de la distancia existente entre el modelo local y el frontier, utilizando alrededor del 64% del coste de ejecutar todo el trabajo directamente con el modelo frontier.

Ese puede ser el modelo económico realmente disruptivo. No: local o cloud. Sino: local primero, cloud cuando compense.

Una arquitectura de IA por niveles

Podríamos imaginar entonces una arquitectura como esta:

Nivel 1 Local: Datos privados, tareas rutinarias, clasificación, lectura documental, búsquedas internas, generación sencilla y ejecución intensiva de tokens.

Nivel 2 Modelos corporativos: Modelos alojados dentro de infraestructura controlada por la organización.

Nivel 3 Servicios cloud: Búsqueda web, aplicaciones SaaS y servicios externos.

Nivel 4 Frontier models: Los problemas que realmente necesitan la máxima capacidad de razonamiento disponible.

El agente decide hasta dónde necesita subir. Y nosotros decidimos qué información puede acompañarlo.

Portable Computer implementa precisamente parte de esa filosofía: puede trabajar localmente con archivos y posteriormente recurrir a búsqueda web, conectores o a más de 15 modelos frontier cuando una tarea necesita capacidades externas.

Pero el modelo frontier nunca necesita tocar tus archivos

Aquí aparece otro detalle técnico especialmente interesante.

Según la explicación facilitada durante el lanzamiento, antes de escalar determinadas consultas hacia el advisor cloud, el harness analiza el contexto saliente mediante un clasificador de PII y permite revisar qué información abandonaría el dispositivo.

Además, el modelo remoto devuelve orientación textual al agente local.

No recibe control directo sobre nuestros archivos ni sobre las herramientas locales.

El patrón es conceptualmente muy potente: el modelo local mantiene las manos; el modelo frontier presta temporalmente el cerebro.

Esto permite diseñar agentes donde capacidad y permisos están desacoplados.

Un modelo enormemente potente puede aconsejar al sistema sin recibir necesariamente acceso completo a nuestros recursos.

Para entornos empresariales puede ser incluso más importante que el ahorro de tokens.

Privacidad y economía empiezan a converger

Normalmente hablamos de privacidad y coste como dos problemas diferentes.

Con la IA local empiezan a convertirse en la misma decisión arquitectónica.

Si procesamos un contrato localmente:

  • los datos no necesitan abandonar el dispositivo;
  • no consumimos inferencia mediante una API externa.

Si analizamos 50.000 documentos localmente:

  • reducimos movimiento de información sensible;
  • reducimos simultáneamente el coste variable asociado al procesamiento.

Perplexity plantea precisamente que, cuando los agentes empiezan a extenderse por workflows completos y organizaciones enteras, tanto el movimiento de datos como el gasto en tokens se vuelven más difíciles de gobernar.

Es fácil imaginar esta discusión en sectores como:

  • banca,
  • seguros,
  • legal,
  • salud,
  • ingeniería,
  • defensa,
  • administraciones públicas,
  • I+D,
  • o cualquier compañía trabajando con propiedad intelectual sensible.

No será solamente: “¿puedo enviar estos datos a Copilot, ChatGPT, Claude o Gemini?”. También será: “¿por qué tengo que enviarlos?”

Los benchmarks muestran que el harness importa muchísimo

Perplexity también ha publicado sus propios experimentos comparando diferentes agent harnesses ejecutando el mismo modelo local.

En su Local Knowledge Work Bench, formado por 53 tareas relacionadas con investigación, análisis financiero y creación documental, Computer con Qwen 3.8 27B sobre DGX Spark obtuvo un 82,6%, frente al 77,6% utilizando Pi y el 74% utilizando Hermes.

Su modelo postentrenado PPLX 27B elevó el resultado al 85,4%.

En BrowseComp, Computer consiguió un 66,7%, frente al 50,2% de Pi y el 43,9% de Hermes, utilizando además menos tiempo y tokens en las pruebas publicadas por la compañía.

De nuevo: son benchmarks publicados por Perplexity y deberían reproducirse independientemente. Pero existe una enseñanza interesante incluso aunque ignoremos los números concretos.

Durante los últimos años hemos estado obsesionados con elegir modelos.

  • GPT contra Claude.
  • Claude contra Gemini.
  • Modelos propietarios contra modelos abiertos.

Los agentes introducen otra variable enorme: el sistema que rodea al modelo.

  • Prompts.
  • Herramientas.
  • Memoria.
  • Context management.
  • Planificación.
  • Sandbox.
  • Skills.
  • Verificación.
  • Retries.
  • Routing.

Un modelo ligeramente inferior dentro de un harness excelente puede terminar produciendo mejores resultados que un modelo superior dentro de una arquitectura mediocre.

Los modelos pequeños necesitan arquitecturas diferentes

Perplexity afirma haber detectado además un problema interesante trabajando con modelos locales.

Aunque determinados modelos anuncien ventanas de contexto enormes, su capacidad para utilizar eficazmente todo ese contexto puede degradarse mucho antes del límite teórico.

Según las pruebas descritas alrededor del lanzamiento, Qwen 3.8 27B empieza a mostrar dificultades cuando las conversaciones agentic crecen considerablemente, aunque soporte formalmente contextos mucho mayores.

Por eso Computer utiliza un harness deliberadamente reducido.

  • Menos herramientas cargadas permanentemente.
  • Prompts más compactos.
  • Capacidades que se incorporan dinámicamente como skills.
  • Conectores transformados en interfaces más ligeras cuando es posible.

Esto conecta con algo que veremos cada vez más: no podemos diseñar agentes locales como si simplemente fueran GPT-5 con menos parámetros.

Un modelo pequeño necesita una arquitectura diseñada alrededor de sus limitaciones.

Y aquí aparece NVIDIA

Todo esto también explica por qué Portable Computer es estratégicamente interesante para NVIDIA.

NVIDIA ha construido buena parte de su narrativa reciente alrededor de centros de datos gigantescos. Gigavatios. Clusters. Blackwell. Fábricas de IA. Capex de miles de millones.

Pero existe un segundo mercado potencial: poner una pequeña fábrica de IA encima de cada escritorio.

DGX Spark utiliza la plataforma Grace Blackwell GB10, con CPU Arm de 20 núcleos y 128 GB de memoria unificada, permitiendo ejecutar modelos considerablemente mayores que los que caben en una GPU de consumo convencional.

Y NVIDIA está posicionando explícitamente el dispositivo para inferencia local y agentes autónomos funcionando durante largos periodos. Eso convierte Portable Computer en algo parecido a una killer app para DGX Spark.

Puedes vender una máquina diciendo que tiene 128 GB de memoria unificada. O puedes venderla diciendo: “Aquí puede vivir tu equipo de agentes de IA.”

La segunda historia es bastante más poderosa.

Perplexity y NVIDIA llevan tiempo acercándose

La colaboración tampoco empieza aquí.

En junio de 2025, NVIDIA anunció acuerdos con múltiples desarrolladores de modelos y proveedores europeos para impulsar infraestructura y modelos de IA soberana.

Perplexity formaba parte de ese ecosistema: los modelos soberanos optimizados mediante NVIDIA Nemotron podrían distribuirse también a través de Perplexity. La filosofía tiene bastante relación con Portable Computer.

La IA soberana plantea: mis datos, mi infraestructura, mis modelos, mi jurisdicción. Portable Computer aplica una idea parecida a escala individual: mis datos, mi ordenador, mi agente. De la soberanía nacional de la inteligencia a la soberanía del dispositivo.

Un futuro con clusters de IA en el escritorio

Y NVIDIA parece pensar que el concepto puede escalar.

Durante el briefing del lanzamiento, representantes de NVIDIA explicaron que múltiples DGX Spark pueden conectarse para ejecutar modelos considerablemente mayores; hablaron de configuraciones con dos, cuatro e incluso más dispositivos para modelos open-weight de clase frontier.

Eso abre un escenario curioso. En una pequeña empresa podríamos tener un cluster local dedicado permanentemente a:

  • procesar documentación,
  • revisar código,
  • preparar propuestas,
  • analizar datos,
  • supervisar sistemas,
  • generar contenidos,
  • clasificar correo,
  • crear informes
  • o ejecutar agentes específicos para diferentes departamentos.

Una especie de servidor de empleados digitales dentro de la oficina.

Suena exagerado hoy.

También sonaba exagerado hace pocos años ejecutar un modelo de decenas de miles de millones de parámetros encima de una mesa.

Hay una limitación bastante grande: el hardware

Portable Computer todavía está lejos de convertirse en una solución para cualquier portátil.

DGX Spark es hardware especializado.

Y para los futuros equipos RTX, el objetivo mínimo se sitúa alrededor de 24 GB de VRAM, aproximadamente el territorio de una RTX 3090 o superior. Eso deja fuera a una gran parte de los ordenadores actuales.

El contador a cero importa más que el benchmark

Durante una de las demostraciones, Portable Computer recibió una carpeta con documentación financiera.

El agente fue analizando los documentos uno detrás de otro sobre DGX Spark.

Mientras trabajaba había un detalle casi absurdo en la interfaz: el contador de créditos no se movía. Seguía en cero. Porque toda la inferencia estaba ocurriendo dentro del dispositivo. Ese pequeño detalle representa probablemente mejor el cambio que cualquier benchmark.

Durante los últimos años hemos optimizado la inteligencia artificial alrededor de:

  • tokens por segundo,
  • tokens por dólar,
  • precio por millón de tokens,
  • coste de entrada,
  • coste de salida.

Portable Computer plantea otra métrica: tokens que ya no necesitamos comprar.

El futuro probablemente no será cloud contra local

No creo que estemos ante el principio del fin de la IA cloud.

Al contrario.

Los modelos frontier seguirán necesitando infraestructuras enormes y continuarán siendo superiores para muchos problemas complejos.

Pero sí creo que estamos entrando en una arquitectura mucho más interesante:

Local AI + Enterprise AI + Cloud AI + Frontier AI.

El agente utilizará cada capa solamente cuando tenga sentido. El trabajo sencillo y privado puede quedarse local. Los datos empresariales pueden permanecer dentro de infraestructura corporativa. La información actual puede venir de Internet.

Y el razonamiento extraordinariamente complejo puede escalar hacia un modelo frontier.

No necesitamos elegir una única inteligencia. Necesitamos orquestarlas.

La pregunta que puede cambiar en los próximos años

Durante los últimos tres años hemos preguntado continuamente:

“¿Qué modelo utilizas?”

  • GPT.
  • Claude.
  • Gemini.
  • Llama.
  • Qwen.
  • Mistral.

Pero con los agentes, quizá esa deje de ser la pregunta principal.

Puede que empecemos a preguntar: “¿Dónde se está ejecutando esta tarea?”

  • En mi portátil.
  • En una workstation.
  • En un servidor de mi empresa.
  • En Azure.
  • En un proveedor especializado.
  • En un modelo frontier.

Y posiblemente la respuesta cambie durante la ejecución de una misma tarea. Eso es lo realmente interesante de Portable Computer. No que Perplexity haya conseguido ejecutar Qwen sobre un DGX Spark. Eso es relativamente anecdótico.

Lo importante es que estamos empezando a convertir el ordenador que tenemos encima de la mesa en infraestructura para trabajadores digitales autónomos.

Máquinas que pueden estar horas pensando, leyendo, ejecutando y verificando. Sin mirar continuamente el taxímetro de tokens. Hasta ahora comprábamos ordenadores para trabajar con ellos. Puede que la próxima categoría sea diferente. Compraremos ordenadores para que nuestros agentes trabajen en ellos.

¿Quieres saber más sobre las soluciones de inteligencia artificial generativa de Microsoft? Yo te asesoro. ¿Por qué no me preguntas cómo puedo ayudarte?

Información basada en la publicación Perplexity partners with Nvidia to launch Portable Computer, a fully local AI agent with zero token costs

Resume o comparte este contenido a través de:

Publicaciones Similares

¿Te ha parecido interesante? ¿Tienes dudas sobre el contenido?
Para cualquier pregunta ponte en contacto conmigo.