NVIDIA PAIR: cómo repartir IA local entre varios PCs sin sumar la VRAM
NVIDIA PAIR reparte solicitudes de IA local entre varios equipos con Ollama o LM Studio. Explicamos qué hace, sus límites y cuándo merece la pena.
NVIDIA PAIR ya está disponible en beta para repartir solicitudes de IA local entre varios equipos de una misma red. La utilidad presenta un único endpoint compatible con Ollama y con la API de OpenAI, descubre nodos Windows, Linux y macOS y envía cada petición independiente al equipo elegible según el motor, el modelo y la carga disponible.
La idea resulta atractiva si en casa o en un pequeño laboratorio ya conviven un PC con GeForce RTX, una estación RTX PRO, un DGX Spark o un Mac reciente. Pero hay un matiz esencial: PAIR no suma la VRAM de varias máquinas ni divide un modelo grande entre ellas. Su función es distribuir peticiones completas, de una en una, para aprovechar capacidad que de otro modo quedaría ociosa.
Resumen rápido: qué aporta NVIDIA PAIR
- Un solo endpoint local: las aplicaciones no necesitan conocer la dirección de cada motor de inferencia.
- Enrutamiento por petición: PAIR elige un nodo compatible en función del motor, el modelo disponible y la carga actual.
- Compatibilidad inicial: trabaja con Ollama y LM Studio y ofrece endpoints compatibles con Ollama y OpenAI.
- Equipos heterogéneos: admite nodos Windows 11, Linux y macOS en arquitecturas x64 y arm64, dentro de los requisitos publicados por NVIDIA.
- Privacidad local: prompts y respuestas pueden permanecer en la red doméstica si la aplicación, el modelo, el motor y todos los nodos también son locales.
- Límite clave: cada petición se ejecuta en una sola máquina; PAIR no crea una GPU virtual ni agrega memoria gráfica.
Qué es NVIDIA Personal AI Router y por qué aparece ahora
NVIDIA presentó Personal AI Router, o PAIR, en el contexto de IFA 2026. El anuncio del 3 de septiembre lo sitúa dentro de una estrategia más amplia para facilitar agentes locales, acelerar inferencia en equipos RTX y aprovechar varios ordenadores de una red personal.
En vez de configurar una aplicación contra cada instancia de Ollama o LM Studio, PAIR crea una capa intermedia. La aplicación habla con un endpoint local y el router decide qué nodo puede atender la petición. Según el playbook oficial, la selección tiene en cuenta la disponibilidad del motor, la presencia del modelo solicitado y la carga del equipo.
Esto encaja especialmente bien con flujos que generan varias peticiones independientes: asistentes que delegan tareas, agentes que consultan documentos en paralelo o pequeños equipos de desarrollo que lanzan inferencias simultáneas. No acelera por arte de magia una única respuesta, pero sí puede reducir esperas cuando existen varias solicitudes y varios nodos válidos.
Lo que PAIR sí hace y lo que no hace
La forma más útil de entenderlo es pensar en una cola con varios trabajadores. Si entran cinco solicitudes y hay tres equipos compatibles disponibles, PAIR puede enviar trabajos independientes a nodos diferentes. No parte una misma solicitud en tres trozos ni permite cargar un modelo de 80 GB repartiendo su memoria entre dos GPU de 40 GB.
PAIR sí puede
- Descubrir y emparejar equipos compatibles dentro de la red local.
- Exponer un endpoint único a aplicaciones y agentes.
- Actuar como proxy para solicitudes compatibles con Ollama y LM Studio.
- Enviar peticiones independientes a nodos con el motor y el modelo adecuados.
- Mezclar sistemas Windows, Linux y macOS compatibles en un mismo clúster personal.
PAIR no puede
- Combinar la VRAM de varios equipos como si fuese una sola GPU.
- Dividir un modelo o una petición individual entre varios nodos.
- Hacer que un modelo incompatible con la memoria de un nodo empiece a caber.
- Garantizar privacidad si la aplicación, el origen del modelo o algún servicio envía datos a la nube.
Este límite evita una expectativa frecuente en torno al hardware para IA local. Si tu problema es que un modelo no cabe en ninguna máquina, PAIR no lo resuelve. Si tu problema es que un PC está saturado mientras otro permanece libre, entonces sí puede aportar.
Hardware y software compatibles en la beta
La documentación de NVIDIA enumera como plataformas principales DGX Spark, GeForce RTX serie 20 o posterior y NVIDIA RTX PRO basada en Turing o posterior. PAIR también puede incorporar sistemas Mac compatibles. La matriz publicada contempla Windows 11, Linux y macOS, con instaladores para x64 y arm64; Windows sobre ARM figura como experimental.
En la parte de inferencia, la beta se apoya en Ollama y LM Studio. Cada nodo que vaya a servir solicitudes necesita el motor correspondiente y una copia local del modelo que deba cargar. Esto importa mucho al preparar el clúster: tener cuatro equipos emparejados no ayuda si solo uno dispone del modelo solicitado.
Si estás valorando un equipo dedicado para este tipo de trabajo, conviene separar marketing de requisitos reales. Nuestra guía sobre AMD Ryzen AI y la memoria disponible para IA local explica por qué la capacidad útil depende tanto de la memoria como del acelerador. También puedes consultar el análisis de NVIDIA Cosmos 3 Edge para ver otro escenario donde ejecutar modelos cerca del dato tiene sentido.
Cómo probar NVIDIA PAIR sin complicar la red
- Empieza con dos equipos: uno ejecutará la aplicación y ambos podrán servir inferencia si tienen un motor compatible.
- Instala PAIR en cada nodo: NVIDIA ofrece paquetes para Windows, Linux y macOS.
- Prepara Ollama o LM Studio: comprueba primero que el modelo responde localmente en cada máquina que quieras usar.
- Usa una red de confianza: el emparejamiento puede hacerse por descubrimiento o por dirección IP y utiliza un PIN temporal de seis dígitos.
- Añade los nodos al clúster: acepta la invitación y verifica que aparecen conectados.
- Apunta la aplicación al endpoint local: PAIR recibirá las peticiones y elegirá un equipo elegible.
- Prueba concurrencia real: lanza varias tareas independientes y observa si se reparten; una única conversación no demuestra la ventaja del sistema.
NVIDIA recomienda no ejecutar a la vez la aplicación de escritorio y la interfaz de terminal en el mismo sistema, porque pueden levantar servicios que compiten por puertos, motores y ajustes. También indica que PAIR acepta solicitudes únicamente desde el sistema local donde está instalado; ese nodo puede usar un motor remoto del clúster aunque no tenga GPU propia.
Qué conviene revisar antes de instalarlo
- Memoria disponible por nodo: cada máquina debe poder cargar por sí sola el modelo que vaya a atender.
- Copias del modelo: revisa almacenamiento y versiones; una descarga distinta en cada equipo puede consumir mucho espacio y producir respuestas diferentes.
- Red cableada cuando sea posible: una Wi-Fi congestionada puede añadir latencia y hacer que el reparto parezca peor de lo que es.
- Confianza entre equipos: empareja solo máquinas controladas y sigue la política de seguridad oficial si trabajas en una red compartida.
- Privacidad de extremo a extremo: que PAIR sea local no impide que otra pieza del flujo mande telemetría, archivos o prompts fuera.
- Objetivo de la prueba: mide capacidad concurrente y estabilidad, no solo tokens por segundo de una única petición.
Para mejorar la conectividad del laboratorio, la guía de configuración real de un router Movistar puede servir como punto de partida doméstico. En entornos más sensibles, además del rendimiento debes separar dispositivos no confiables, controlar el acceso a los nodos y mantener motores y modelos actualizados.
Cuándo merece la pena NVIDIA PAIR
PAIR tiene sentido cuando ya posees dos o más equipos compatibles y generas varias inferencias independientes. Un desarrollador con un sobremesa RTX y un portátil puede dejar que un agente use el nodo libre. Un pequeño estudio puede repartir tareas de clasificación, resumen o generación entre máquinas que no siempre están ocupadas. Un laboratorio doméstico puede probar flujos multiagente sin montar Kubernetes ni mantener un proxy artesanal.
Por el contrario, aporta poco a quien usa un único ordenador, lanza una sola petición cada vez o necesita ejecutar un modelo que no cabe en ningún nodo. En esos casos será más efectivo optimizar el modelo, cuantizarlo, ampliar memoria o elegir hardware adecuado.
Preguntas frecuentes sobre NVIDIA PAIR
¿NVIDIA PAIR suma la VRAM de varios ordenadores?
No. NVIDIA aclara que cada petición se envía a un único sistema y que PAIR no une GPU, no agrega memoria y no divide un modelo entre nodos.
¿Funciona con Ollama y LM Studio?
Sí. Son los motores de inferencia compatibles en la beta documentada, y PAIR expone endpoints compatibles con Ollama y con la API de OpenAI para las aplicaciones.
¿Necesita Internet para funcionar?
La operación local no necesita Internet, según la ficha de NVIDIA, aunque sí hace falta conectividad para descargar PAIR, los motores y los modelos.
¿Los datos permanecen siempre en casa?
Solo si todo el flujo es local: aplicación, modelo, motor y nodos. La presencia de una API o un servicio externo puede sacar información de la red aunque PAIR ejecute localmente.
Fuentes oficiales
- NVIDIA Blog: novedades de IA local presentadas en IFA 2026
- NVIDIA: Personal AI Router para inferencia local
- NVIDIA Build: instalar y utilizar PAIR
- NVIDIA: preguntas frecuentes de PAIR
Conclusión
NVIDIA PAIR convierte varios equipos compatibles de una red local en un conjunto coordinado para atender inferencias independientes. Su valor no está en fabricar una GPU gigante, sino en reducir configuración repetida y aprovechar mejor máquinas que ya existen.
La beta merece una prueba si trabajas con Ollama o LM Studio, tienes varios nodos y tus agentes generan tareas concurrentes. Hazla con modelos idénticos, una red de confianza y métricas sencillas de cola, latencia y uso por nodo. Así podrás decidir si PAIR resuelve un cuello de botella real o solo añade otra capa al laboratorio.
