Agentes de IA locales vs. agentes en la nube para trabajo confidencial en 2026
Compara agentes de IA locales, en la nube e híbridos para trabajo confidencial: privacidad, costos, hardware, rendimiento y límites reales en 2026.

Al comparar agentes de IA locales con agentes de IA en la nube para trabajo confidencial en 2026, la opción local es la adecuada cuando el material de origen no puede salir del dispositivo; la nube conviene cuando pesan más el razonamiento avanzado y el acceso a la web en tiempo real; y el nuevo modo híbrido de Perplexity Computer encaja cuando una misma tarea exige ambas cosas. El primer punto de equilibrio claro se sitúa entre 3.2 y 8.7 tareas complejas totalmente locales al mes en una Mac de $1,099 durante tres años, aunque la barrera de privacidad no equivale a un aislamiento de red.
Agentes de IA locales vs. IA en la nube para trabajo confidencial en 2026
Elija la opción local cuando el límite de los datos sea inviolable, la nube cuando necesite el razonamiento más potente y un esquema híbrido para trabajos mixtos que puedan dividirse de forma segura. Ese es el veredicto. Lo difícil es determinar si la tarea realmente admite esa separación.
Una organización regulada que maneja pruebas protegidas por privilegio legal, información financiera aún no publicada, expedientes de pacientes, credenciales de acceso o material sujeto a controles de exportación debe partir de una arquitectura local. La pregunta decisiva no es si un proveedor promete buena privacidad, sino si la política permite que algún prompt, nombre de archivo, descripción de tarea o resultado intermedio llegue a infraestructura externa. Si la respuesta es no, un agente que comienza en la nube queda descartado antes de considerar la calidad del modelo o el precio.
Un fundador con financiación o el CTO de una empresa mediana que trabaja con investigación pública, operaciones de ventas, planificación de producto y documentos internos ordinarios normalmente debería comenzar con un sistema híbrido. El modelo en la nube puede buscar, planificar y resolver el razonamiento difícil; el archivo sensible y la acción protegida permanecen en hardware controlado. Así se conserva buena parte de la ventaja de la nube sin asumir que todos los datos tienen el mismo nivel de riesgo.
Quien desarrolla por su cuenta debe decidir según su principal cuello de botella. Si es un repositorio privado, la ejecución local aporta control y un costo marginal predecible. Si el problema consiste en resolver una arquitectura desconocida o investigar una API cambiante, el razonamiento en la nube suele justificar el gasto variable. No compre una máquina de gran capacidad para resolver un problema de política que no existe.
La regla de decisión es sencilla: el dato más restringido fija el límite mínimo y el paso de razonamiento aprobado más difícil fija el modelo máximo. Si una sola arquitectura no puede cumplir ambos criterios, hay que dividir el flujo. Nunca se debe rebajar el límite solo porque resulte cómodo usar el modelo más potente.
Esta distinción importa porque un modelo local no es lo mismo que un agente local. El modelo puede generar texto en el dispositivo mientras el agente envía telemetría, utiliza una API de búsqueda alojada, guarda el estado en una base de datos en la nube o recurre a un modelo remoto después de fallar. En una ruta verdaderamente local, el modelo, el orquestador, las herramientas, las credenciales, los archivos, los registros y el estado permanecen dentro del límite controlado. El modelo de límites para el procesamiento local de documentos sensibles parte de la misma diferencia.
Perplexity Computer convierte el modelo híbrido en la opción predeterminada para trabajos con distintos niveles de confidencialidad
Perplexity Computer ahora divide una misma tarea entre razonamiento en la nube y procesamiento local en una Mac compatible. Su lanzamiento de Hybrid Compute del 1 de septiembre de 2026 convierte la opción híbrida, hasta ahora abstracta, en un producto gestionado: la nube planifica, busca en la web y se encarga del razonamiento de frontera, mientras el modelo descargado procesa archivos protegidos y ejecuta en el dispositivo las acciones autorizadas. Perplexity detalla los controles de enrutamiento, los planes compatibles, los modelos locales y los requisitos para Mac en su página de lanzamiento.

La barrera de privacidad dirige el tráfico. Puede ocultar un dato sensible, mantener un paso en local, rechazar una acción o pedir el consentimiento del usuario. Los administradores de Enterprise pueden definir reglas para toda la organización y comprobar cuándo sale información del dispositivo. Es mucho más fiable que esperar que cada empleado recuerde qué prompt puede pegar en cada ventana.
Esta arquitectura resulta especialmente útil en trabajos que mezclan contextos. Pensemos en la debida diligencia de una adquisición confidencial. El componente local puede extraer obligaciones y fechas sin identificar a las partes a partir del borrador del contrato. El componente en la nube puede investigar documentos públicos y analizar las implicaciones para el mercado con un resumen depurado. Por último, otro paso local vuelve a vincular el análisis público con la empresa objetivo. El razonamiento en la nube nunca necesita el contrato original ni los nombres de las partes.
El mismo patrón sirve para un repositorio privado. Un modelo local puede revisar archivos propietarios y convertir un error en una descripción abstracta mínima. Un modelo en la nube puede investigar una biblioteca externa y proponer soluciones a partir de esa abstracción. Después, el componente local contrasta la respuesta con el código real. La división funciona porque respeta el límite de la información, en lugar de obligar a ejecutar toda la tarea en el componente menos capaz o en el menos privado.
Hay tres modelos disponibles en local desde el lanzamiento: Gemma 4 E4B, Qwen3.6 35B-A3B y un modelo de Perplexity. Hybrid Compute requiere Apple silicon, macOS 15 o posterior y al menos 24GB de memoria unificada. Está disponible en Pro, Max y Enterprise, y el trabajo realizado por el modelo local descargado no consume créditos de la nube. Por ello, es una opción práctica para una Mac compatible que ya esté en uso, no un motivo automático para comprar hardware nuevo.
Existe una salvedad decisiva: todas las tareas de Hybrid Compute comienzan en la nube. Perplexity lo indica en la página de producto de Hybrid Compute. Los pasos protegidos pueden quedarse en local, pero no se trata de un sistema que arranca solo en el dispositivo y recurre a la nube cuando recibe permiso. La tarea inicial existe en infraestructura de nube. Las organizaciones que no puedan revelar ni siquiera la etiqueta, la intención o un prompt depurado de una tarea no deben utilizarlo para ese flujo de trabajo.
Ganador de la categoría: el modo híbrido de Perplexity Computer gana en trabajos con distintos niveles de confidencialidad. No sustituye a una ejecución completamente local para una tarea aislada de la red ni supera la sencillez de una solución totalmente en la nube cuando el trabajo es público.
Privacidad: ganan los agentes de IA locales
La opción local gana en privacidad porque puede reducir el número de partes y sistemas que llegan a recibir los datos. Se trata de controlar el límite, no de una propiedad de seguridad automática. Una estación de trabajo mal actualizada y con permisos amplios para las herramientas puede ser menos segura que un servicio empresarial en la nube bien gobernado.
Con frecuencia se confunden cuatro arquitecturas:
- Inferencia local significa que los pesos del modelo se ejecutan en su hardware. Por sí sola, no dice dónde guarda la memoria el agente ni a qué herramientas llama.
- Entorno de ejecución local del agente significa que la planificación, las llamadas al modelo, la ejecución de herramientas, el estado y los registros se procesan en local. Las búsquedas o API remotas todavía pueden provocar una salida de datos.
- Acceso local a archivos significa que una aplicación del dispositivo puede abrir archivos. Perplexity Personal Computer, por ejemplo, es una ampliación nativa para Mac de la experiencia Computer basada en web, pero acceder a un archivo local no convierte en local cada paso de razonamiento.
- Operación aislada de la red significa que el entorno controlado no tiene una ruta de red hacia sistemas externos. Por definición, eso impide investigar en la nube en tiempo real.
Requisitos de hardware para inteligencia artificial local
La solución híbrida gestionada de Perplexity fija un umbral claro: Apple silicon, macOS 15 o posterior y 24GB o más de memoria unificada. Un despliegue local más amplio necesita memoria suficiente para el modelo elegido, su contexto de trabajo, el proceso del agente, los índices y las aplicaciones que controla. Por tanto, el requisito real depende de la carga de trabajo. Una máquina capaz de cargar el modelo puede atascarse cuando un documento largo, un índice de código, el navegador y el entorno aislado compiten por la memoria.
Empiece por la menor carga de trabajo representativa, no por la máquina más grande del catálogo. Compruebe que el modelo completa la tarea con un nivel aceptable, que las llamadas a herramientas están restringidas y que el dispositivo puede mantener la concurrencia necesaria. Comprar capacidad antes de las pruebas de aceptación puede terminar en hardware costoso sin uso.
La privacidad también cambia según el tipo de cuenta. Perplexity indica que las cuentas Free, Pro y Max tienen activada de forma predeterminada la retención de datos de IA. El usuario puede impedir que sus datos futuros se recopilen para entrenar IA, pero esa decisión no elimina la información ya recopilada para entrenamiento. La información de consultas de Enterprise no se utiliza para entrenar modelos, y los archivos adjuntos de una sesión se conservan durante siete días, con controles adicionales bajo las condiciones indicadas para la organización. La política vigente de datos de Perplexity explica estas diferencias, y este análisis de privacidad de los agentes en la nube muestra por qué el historial y la memoria merecen una revisión independiente.
La diferencia sigue siendo relevante aunque el último paso protegido se ejecute en local. Una cuenta de consumo, una cuenta Enterprise, una ruta híbrida y un entorno de ejecución local de código abierto representan cuatro posiciones de riesgo distintas. Una expresión de compra como «se ejecuta en local» es demasiado ambigua para aprobar cualquiera de ellas.
Ganador de la categoría: los agentes locales ganan en el control del límite de los datos confidenciales. Una nube empresarial aún puede ofrecer mayor seguridad general si la organización no puede actualizar, supervisar y gobernar sus dispositivos de forma fiable, pero no puede garantizar literalmente que no haya salida de datos mientras procesa el trabajo de manera remota.
Razonamiento e información actual: ganan los agentes de IA en la nube
El servicio en la nube de Perplexity Computer gana cuando una tarea necesita razonamiento de frontera, información web actual, conectores alojados o capacidad inmediata sin ajustar el dispositivo. Ejecuta las tareas en un entorno aislado en la nube, conserva memoria de trabajo persistente y puede coordinar GPT-5.6 Sol, Claude Opus 5 y Claude Sonnet 5 cuando el plan y los créditos disponibles lo permiten, según la documentación de Computer y la lista actual de modelos de Perplexity.

Una tarea de análisis de mercados públicos ilustra la ventaja. El agente quizá deba buscar documentos recientes, conciliar datos de varios sitios web, construir un modelo y revisar su plan cuando las fuentes discrepan. Un agente alojado puede consultar servicios actuales y alternar entre modelos potentes sin obligar al usuario a descargar pesos, dimensionar la memoria o administrar un servidor de inferencia local. Cuando las entradas son públicas, esas facilidades aportan un valor operativo real.
Las mediciones independientes de modelos también explican por qué no debe suponerse que la calidad local es equivalente. Artificial Analysis registra una puntuación de 32 en Intelligence Index para Qwen3.6 35B-A3B Reasoning y de 63 para Claude Opus 5 Adaptive Reasoning con el máximo nivel de esfuerzo. La medición de Qwen y la medición de Claude proceden de la entidad que realizó las pruebas, no de este sitio.
Es una señal orientativa, no una puntuación de los productos finales de Perplexity. Artificial Analysis midió el modelo base alojado de Qwen, mientras que Perplexity utiliza un modelo local con posentrenamiento y lo integra en un sistema de agentes. Las herramientas, el enrutamiento, los prompts y la verificación pueden cambiar el resultado. Aun así, una diferencia de ese tamaño respalda la expectativa práctica de que el razonamiento difícil suele beneficiarse de escalar a la nube.
La nube tiene sus propios modos de fallo. El consumo variable de créditos puede ser difícil de prever. Una tarea larga puede seguir durante mucho tiempo un plan equivocado y costoso. Los conectores y la memoria persistente amplían la superficie de datos. Las interrupciones del proveedor, los cambios de política y las sustituciones de modelos quedan fuera del control directo del usuario. La comodidad se obtiene a cambio de dependencia.
Ganador de la categoría: los agentes en la nube ganan en amplitud de razonamiento, investigación en tiempo real, rapidez de configuración y capacidad para picos de demanda. La opción local sigue ganando cuando esas ventajas no justifican la salida de datos.
El ganador en costos depende de la carga de trabajo
La comparación no se reduce a contraponer una suscripción con software gratuito. Para que sea justa, ambas opciones deben ejecutar la misma carga y contabilizar la máquina, el plan, el uso y la carga operativa. Lo útil es calcular el punto de equilibrio, no afirmar de manera universal que la opción local es más barata.
Los precios se verificaron en páginas activas de los proveedores el 2 de septiembre de 2026. Perplexity Pro cuesta $20 al mes o $200 al año. Normalizado, el plan anual equivale a $16.67 por puesto al mes. Perplexity Max cuesta $200 al mes o $2,000 al año, equivalentes a $166.67 por puesto al mes. El contexto actualizado de los planes de Perplexity resulta útil si la decisión de suscripción abarca más que Computer.
La página de facturación de Computer convierte 100 créditos en $1. Pro no incluye una asignación mensual recurrente de créditos de Computer, aunque ofrece una bonificación única de 4,000 créditos que vence después de 30 días. Max incluye 10,000 créditos mensuales, con un valor de $100 según esa conversión, más una bonificación única de 35,000 créditos que también vence después de 30 días. La diferencia mensual entre Max anual y Pro anual más $100 en créditos comprados por separado es de $50. Otros servicios de Max pueden justificarla, pero el valor de los créditos incluidos por sí solo no lo hace.
El mejor hardware para inteligencia artificial local
La mejor primera máquina es la compatible que ya está sobre el escritorio. En ese caso, el costo incremental de entrada del hardware es de $0. Una Apple Mac mini M6 nueva, configurada con 24GB de memoria unificada y 256GB de almacenamiento, figuraba por $1,099, con disponibilidad a partir del 22 de septiembre de 2026. Amortizada durante 36 meses, supone $30.53 al mes antes de energía, asistencia, reparaciones o valor residual. La configuración vigente de Apple aporta el precio de compra, mientras que Perplexity establece el requisito de 24GB.
Al sumar el plan Pro anual, el puesto híbrido gestionado cuesta $47.19 al mes más los créditos correspondientes a cualquier parte enviada a la nube. Con 10 tareas al mes que puedan completarse íntegramente en local, solo el hardware cuesta $3.05 por tarea a lo largo de tres años. Según la página de facturación en la nube de Perplexity, una tarea Complex típica consume entre 350 y 950 créditos, es decir, $3.50 a $9.50. El punto de equilibrio del hardware se sitúa así entre 3.21 y 8.72 tareas mensuales equivalentes a Complex y totalmente locales.
Ese cálculo exige una condición estricta: la ruta local debe producir el mismo resultado aceptable y evitar el cargo de nube durante toda la tarea que cumple los requisitos. Si el intento local consume tiempo del operador y después escala de todos modos a la nube, se pagan ambos costos. Si la organización ya posee hardware compatible, desaparece el punto de equilibrio del hardware, pero no los gastos de energía y operación.
También hay una discrepancia en los precios publicados por el propio proveedor que conviene señalar. La página vigente de créditos de Computer ofrece dos rangos incompatibles para las tareas Light: el resumen rápido indica entre 15 y 70 créditos, mientras que la tabla muestra entre 100 y 350. Ninguno debería incluirse en un modelo de decisión hasta que Perplexity resuelva la contradicción. Los rangos publicados más claros son Complex, de $3.50 a $9.50; Heavy, de $8.75 a $22.75; y Mega, de $24 a $98.
La misma carga de trabajo: local, híbrida y en la nube
Perplexity ejecutó 89 tareas de programación de Terminal Bench 2.1 con tres configuraciones relacionadas. Su ejecución local con Qwen 3.8 27B completó el 59.6% con un costo de API prácticamente de $0. Qwen con Claude Opus 5 como asesor alcanzó el 73.0% por un costo estimado de $0.415 por ejecución. Claude Opus 5 por sí solo llegó al 82.4% por $0.65. Son resultados del propio benchmark de Perplexity, no una prueba independiente.

En 1,000 ejecuciones, la estimación medida de API es de $415 para la opción híbrida frente a $650 para la nube, una diferencia de $235 o 36.2%. Perplexity utilizó una NVIDIA DGX Spark para el componente local. El aviso de precio vigente de NVIDIA la sitúa en $4,699, mientras que la especificación oficial indica 128GB de memoria unificada y 4TB de almacenamiento NVMe con autocifrado. Con un ahorro de $0.235 por ejecución, el punto de equilibrio limitado al hardware llega aproximadamente a las 19,996 ejecuciones, o unas 556 al mes durante 36 meses. Con 1,000 ejecuciones mensuales, el uso de API híbrida más la amortización del hardware durante 36 meses suma $545.53, frente a $650 para la nube únicamente.
Ese resultado no puede extrapolarse directamente a todos los compradores. Terminal Bench es un benchmark para agentes de programación. Perplexity midió su propio sistema. La ejecución utilizó Qwen 3.8 27B en DGX Spark, no la configuración exacta del lanzamiento de septiembre para Mac. Se excluyen energía, asistencia, suscripción y tiempo del operador. La cifra es valiosa porque la carga de trabajo es equivalente, pero no constituye un estudio universal del costo total.
Las referencias por token muestran la misma tendencia en una unidad menor. Artificial Analysis sitúa Qwen3.6 alojado en $0.38 por millón de tokens de entrada y $2.25 por millón de tokens de salida. Es decir, $0.00038 y $0.00225 por cada 1,000 tokens. Claude Opus 5 cuesta $5 y $25 por millón, o $0.005 y $0.025 por cada 1,000. Estos precios normalizan las mismas unidades de tokens, pero no son créditos de Perplexity Computer ni miden la electricidad local.
Ganador de la categoría: la opción local gana con un flujo constante de tareas que puede terminar; la nube gana con trabajo esporádico, difícil o sujeto a picos. El modelo híbrido justifica su costo en los casos intermedios, siempre que el asesor eleve lo suficiente la tasa de finalización para evitar repetir el trabajo.
La barrera de privacidad no es un aislamiento de red
Una barrera de privacidad es una capa de clasificación y políticas. Un aislamiento de red es la ausencia de una ruta de red. Resuelven problemas distintos, y confundirlos es el error más grave al tomar esta decisión.
La ruta híbrida de Perplexity puede inspeccionar una solicitud en local, ocultar datos, conservar un paso protegido en el dispositivo, pedir consentimiento o negarse a actuar. Sin embargo, todas las tareas comienzan en la nube. Por eso, una política bien diseñada puede reducir al mínimo el contenido protegido que sale de la Mac, pero no convertir el producto en un agente local desconectado.
El detector también tiene límites medibles. Perplexity describe PII-Tracer como un detector local de 0.6 mil millones de parámetros y publica resultados en PII-TRACE, un benchmark sintético de 13,148 conversaciones en 13 idiomas, 10 sistemas de escritura y nueve tipos de PII. Obtuvo una puntuación F1 por caracteres de 0.629, la más alta entre los 12 sistemas evaluados por Perplexity. La publicación de investigación presenta el diseño y los resultados del benchmark.
El contexto largo es el punto más delicado. En conversaciones de 10,000 caracteres o más, la exhaustividad en una sola ventana cayó al 68.7%. El uso de ventanas superpuestas elevó la exhaustividad general por caracteres al 96.5% y la detección coherente de varias menciones al 95.4%. Mejor no significa perfecto. Las conversaciones son sintéticas y la publicación indica que está previsto lanzar pronto el modelo y el benchmark. Una afirmación de privacidad no puede redondear honestamente el 95.4% hasta convertirlo en certeza.
El detector busca además información de identificación personal, no todas las formas de información empresarial sensible. Una vulnerabilidad en el código fuente, un precio aún no publicado, una posición negociadora o el nombre de un proyecto secreto pueden ser altamente confidenciales sin encajar en una categoría convencional de PII. Las reglas de política y el consentimiento del usuario deben cubrir aquello que el detector no comprende.

Utilice cinco clasificaciones prácticas:
- Secretos aislados de la red: claves, investigación restringida, archivos sujetos a controles de exportación o material cuya propia existencia sea sensible. Mantenga todo el agente en local y desconectado.
- Expedientes privilegiados o regulados: use una ruta totalmente local, salvo que el área legal, la política y el contrato aprobado con el proveedor permitan expresamente una ruta de nube definida.
- Información empresarial confidencial: una solución local o híbrida puede servir. Identifique los campos que deben permanecer en el dispositivo y exija un registro de salida de datos.
- Documentos mixtos: separe los campos protegidos de las preguntas públicas. Es el caso de uso híbrido más sólido.
- Entradas públicas: la nube suele ser la opción más sencilla, sujeta a la revisión habitual de la cuenta y de los resultados.
La clasificación debe ocurrir antes de que un empleado inicie un agente. Un aviso de consentimiento que aparece después de que el texto privado ya se haya incorporado a una solicitud en la nube no constituye un control real. La barrera de privacidad debe intervenir antes de la salida de datos y denegarla de forma predeterminada cuando la clasificación sea incierta.
Ganador de la categoría: una solución totalmente local gana cuando el límite es absoluto. El modelo híbrido gana con divulgación selectiva solo si se abordan los fallos del detector, los secretos que no son PII, el consentimiento y la capacidad de auditoría.
Modelos de IA locales: a qué se renuncia
Un modelo local compra control a cambio de un margen de capacidad limitado. Debe caber en la máquina, responder con suficiente rapidez para el flujo de trabajo y operar sin toda la amplitud de herramientas alojadas y razonamiento de frontera. El intercambio puede ser excelente para extraer, clasificar y transformar información, buscar en repositorios y ejecutar acciones repetitivas dentro de un dominio conocido. Resulta menos favorable cuando la tarea es ambigua, novedosa, intensiva en investigación o dependiente de información actual.
La elección del modelo depende del umbral de aceptación. Un modelo más pequeño y rápido puede ser ideal para identificar campos en una plantilla de contrato conocida. Ese mismo modelo puede ser una mala opción al interpretar una estructura de indemnización novedosa en varias jurisdicciones. Enviar ambos trabajos al mismo entorno de ejecución porque ya está instalado convierte la comodidad arquitectónica en riesgo empresarial.
El patrón más limpio es un escalado acotado. El componente local genera una descripción depurada del problema y una señal de confianza. La ayuda de la nube solo se autoriza para categorías aprobadas. Después, la recomendación vuelve al componente local para contrastarla con el contexto protegido. Si ninguna abstracción segura conserva el significado, la tarea permanece en local o pasa a una persona.
Agente de IA local para programación
La programación deja el intercambio en evidencia. Un agente local puede indexar un repositorio privado, buscar símbolos propietarios, ejecutar pruebas y editar archivos sin subir el código. Así ofrece un control sólido del límite y un bajo costo incremental del modelo. Aun así, puede tener dificultades con un error complejo entre sistemas, un framework nuevo o una larga cadena de razonamiento arquitectónico.
El benchmark híbrido de programación mostró el camino intermedio: un ejecutor local con un asesor en la nube elevó la finalización del 59.6% al 73.0%, mientras que la solución exclusivamente en la nube alcanzó el 82.4%. La decisión clave no es simplemente «usar dos modelos», sino definir qué evidencias recibe el asesor. Un error abstracto, la versión pública de una dependencia y un caso de prueba reducido quizá puedan compartirse. Un repositorio privado completo o una credencial, no.
Mantenga restringidos los permisos de las herramientas del agente local. Separe lectura, edición, ejecución, red y acceso a secretos. Exija revisión antes de comandos destructivos o solicitudes salientes. Un modelo privado con acceso sin límites al shell y al navegador puede provocar un incidente mayor que un asistente en la nube de solo lectura.
Ganador de la categoría: la opción local gana en trabajo privado y repetitivo sobre repositorios; la nube, en programación desconocida y exigente en razonamiento; la híbrida, solo cuando el paquete de escalado puede reducirse de forma segura.
Costos de cambio y quién no debería migrar
Migrar no consiste solo en descargar un modelo. Cambia dónde reside el estado, cómo se autentican las herramientas, quién actualiza el entorno de ejecución y qué pruebas puede inspeccionar un auditor. El costo de la migración suele superar la primera factura de hardware.
Pasar de la nube a una solución local exige hardware compatible, distribución de modelos, índices locales, entornos aislados, almacenamiento de credenciales, copias de seguridad, supervisión, gestión de actualizaciones y un conjunto de pruebas de aceptación. Es posible que las memorias, el estado de los conectores y los historiales de tareas de la nube existente no se puedan exportar en un formato útil. Aunque los datos sin procesar sean portátiles, el comportamiento de trabajo codificado en prompts, políticas y herramientas específicas del proveedor quizá no lo sea.
Migrar de local a la nube tiene otro costo. Los datos deben clasificarse antes de subirlos. Hay que aprobar las condiciones de identidad, retención, entrenamiento, región, subencargados y auditoría. Los scripts e índices locales necesitan equivalentes alojados. Un flujo que funcionaba sin conexión pasa a depender de la disponibilidad del proveedor y de la política de la cuenta. Los créditos variables sustituyen parte del costo fijo de infraestructura, pero también aumentan la variación presupuestaria.
El modelo híbrido añade trabajo de enrutamiento en lugar de eliminar el trabajo de migración. Cada paso necesita un responsable y un límite. Los equipos deben decidir qué texto se puede ocultar, qué archivos nunca salen del dispositivo, qué nivel de confianza activa una revisión y cómo reconstruir un incidente a partir de los registros. Sin esas decisiones, «híbrido» se convierte en una etiqueta atractiva sobre una ruta de datos que nadie ha examinado.
Cómo crear un agente de IA local
Comience con un solo flujo de trabajo acotado y compruébelo con entradas similares a las de producción. Una migración de toda la infraestructura oculta los fallos; un piloto limitado los hace visibles.
Trace la ruta real de los datos
Enumere el modelo, el orquestador, los archivos, el índice vectorial, el almacén de memoria, las herramientas, las credenciales, los registros, la telemetría, el servicio de actualizaciones y cada llamada de red. Marque cada componente como local, remoto aprobado o prohibido. Un diagrama que solo muestra el modelo está incompleto.
Defina el conjunto de aceptación
Elija 20 tareas representativas, incluidos casos ordinarios, entradas largas, documentos mal formados, fallos de herramientas y la categoría sensible de mayor nivel permitida. Registre la finalización, los minutos del operador, los eventos de salida y los créditos. El número del piloto es una recomendación operativa, no una afirmación de benchmark.
Restrinja las herramientas antes de añadir autonomía
Conceda al agente únicamente las rutas de archivos, los comandos y los destinos de red que necesite. Separe la lectura de la escritura y de la ejecución. Añada aprobación para acciones destructivas, dominios nuevos, acceso a secretos y cualquier transición de local a la nube.
Establezca la regla de escalado
Defina qué condiciones de fallo deben permanecer en local, pasar a una persona o crear una solicitud depurada para la nube. Compruebe que los datos prohibidos no aparezcan en prompts, nombres de archivo, registros, capturas de pantalla ni resultados de herramientas. Repita las pruebas después de cada cambio de modelo, política o conector.
No migre a una solución local si la organización carece de administración de dispositivos, tiene una demanda muy variable con picos, depende de fuentes web en tiempo real o no puede mantener actualizados el modelo y el entorno aislado. Las máquinas sin gestionar y el software obsoleto pueden anular la ventaja de privacidad.
No traslade trabajo confidencial a la nube solo para mejorar la calidad del modelo cuando la política prohíbe la salida de datos. También conviene evitar esa migración si el flujo debe funcionar sin conexión o si una capa de memoria y conectores propia de un proveedor crearía una dependencia inaceptable.
No adopte un modelo híbrido si la organización no puede explicar la política de enrutamiento en una página. Una política que exige a los usuarios detectar cada secreto en un documento largo no es un control. Que un detector encuentre la mayoría de la PII no autoriza a transmitir todo lo demás.
El mejor destino de migración puede ser una cartera y no una única plataforma: solo local para datos prohibidos, un modelo híbrido gestionado para trabajo separable y la nube para material público o aprobado. Mantener tres rutas tiene un costo operativo, pero cada una existe por una razón clara.
Preguntas frecuentes
¿Cuál es el mejor agente de IA en 2026?
No existe un único agente que sea el mejor para todos los límites de datos. Un agente totalmente local es el más adecuado cuando la información no puede salir del hardware controlado. El modo híbrido de Perplexity Computer encaja bien como opción gestionada para combinar trabajo privado y público en una Mac compatible. Un agente en la nube es mejor cuando importan sobre todo el razonamiento de frontera, la investigación en tiempo real y una baja carga de configuración.
¿Cuál es la diferencia entre la IA local y la IA en la nube?
La IA local ejecuta el modelo y la ruta de datos en hardware bajo su control. La IA en la nube envía la carga de trabajo a la infraestructura del proveedor para ejecutar el modelo. Una arquitectura híbrida divide la tarea: mantiene los pasos protegidos en el dispositivo y envía a un modelo en la nube el razonamiento o la investigación aprobados. La ubicación del modelo por sí sola no demuestra que todo el agente sea local.
¿Cuál es el mejor agente de IA para el trabajo?
Para investigación pública y automatización general de oficina, la nube suele ser la opción más sencilla. Para material aislado o prohibido, utilice un agente totalmente local. Para trabajo confidencial mixto, use una ruta híbrida auditable solo si la política de salida especifica qué permanece en local, qué se puede ocultar y qué requiere aprobación.
¿Los agentes de IA pueden ejecutarse en local?
Sí. Un agente completamente local mantiene el modelo, el orquestador, las herramientas, el estado, los registros y los archivos en hardware controlado. Una aplicación que abre archivos locales pero planifica en la nube no es totalmente local. Revise cada componente y llamada de red en lugar de confiar en la etiqueta del producto.
¿Cuáles son los 5 tipos de agentes de IA?
La jerarquía conceptual habitual de IBM incluye agentes reflejos simples, agentes reflejos basados en modelos, agentes basados en objetivos, agentes basados en utilidad y agentes de aprendizaje. IBM describe los cinco niveles como formas de capacidad de decisión cada vez mayores. La taxonomía se refiere a cómo elige sus acciones un agente. Cualquiera de esas ideas puede implementarse de forma local, en la nube o mediante un despliegue híbrido.
¿Hay algún agente de IA local gratuito?
Los frameworks de código abierto y los pesos de modelos pueden no cobrar licencia, pero un agente de producción no carece de costos. Hardware, electricidad, actualizaciones, copias de seguridad, almacenamiento de secretos, entornos aislados, evaluación y tiempo del operador siguen formando parte del presupuesto. También hay que revisar las licencias antes de un uso comercial.
¿Qué agente de IA es mejor para ejecutarlo en local?
Perplexity Hybrid Compute es una opción gestionada con pocas fricciones para un flujo compatible en Mac, pero es híbrida porque todas las tareas comienzan en la nube. Una solución de código abierto totalmente local ofrece mayor control del límite y portabilidad a cambio de más trabajo operativo. La mejor opción es el sistema más pequeño que supere la tarea real y la política de datos.
¿Qué agente de IA es totalmente gratuito?
Ningún agente de producción es totalmente gratuito cuando se contabilizan hardware, energía, administración, seguridad, copias de seguridad y respuesta a incidentes. Una descarga sin precio puede ser la ruta más barata con un volumen estable, pero traslada el costo del uso del proveedor a la infraestructura y el trabajo.
¿Puedo ejecutar IA agéntica en local?
Sí, siempre que el modelo, el entorno de ejecución del agente, el estado, las herramientas y el entorno de ejecución quepan y permanezcan en hardware controlado. Desactive o apruebe expresamente los puntos remotos de telemetría, búsqueda, actualización y modelos. Si el agente se conecta a internet, descríbalo como local-first o híbrido, no como totalmente local.
¿La IA local es mejor que la IA en la nube para trabajo confidencial?
La opción local es mejor para mantener un límite estricto porque los datos pueden permanecer en hardware gobernado por la organización. No es automáticamente mejor en razonamiento ni en seguridad operativa. Una nube Enterprise gestionada puede supervisarse mejor que un equipo portátil sin administrar, aunque siga sin ser apta para datos que no deben salir del dispositivo.
¿Puede un agente de IA local investigar en la nube?
Sí, pero en cuanto utiliza un modelo remoto o un servicio de búsqueda, el flujo se vuelve híbrido. Genere en local una solicitud de investigación depurada, revele solo el contexto aprobado, registre la salida y valide la respuesta con la fuente privada en el dispositivo. Si la pregunta no puede anonimizarse sin perder significado, manténgala en local o recurra a una revisión humana.
¿Cuál es la diferencia de precio entre los agentes de IA locales y en la nube?
En el ejemplo gestionado equivalente, Pro anual cuesta $16.67 al mes. Si se añade una Mac de $1,099 amortizada durante 36 meses, el puesto híbrido asciende a $47.19 antes de los créditos enviados a la nube. Pro anual más 10 tareas Complex típicas en la nube cuesta entre $51.67 y $111.67. El punto de equilibrio del hardware local está entre 3.21 y 8.72 tareas que cumplan los requisitos al mes, siempre que los resultados sean equivalentes.
¿Cuál es el mejor modelo de IA local?
No existe un ganador universal. La elección depende de la memoria disponible, la calidad en la tarea, la latencia, el uso de herramientas y la licencia. Perplexity lanzó su modo gestionado para Mac con Gemma 4 E4B, Qwen3.6 35B-A3B y un modelo de Perplexity. Pruebe el candidato más pequeño con entradas protegidas similares a las de producción antes de estandarizarlo.
¿Cuál es el mejor equipo para IA local?
La primera opción más económica es una máquina compatible que ya exista, porque su costo de compra incremental es de $0. Para el modo Mac de Perplexity, eso significa Apple silicon, macOS 15 o posterior y al menos 24GB de memoria unificada. Compre hardware específico solo después de que un piloto demuestre que el tamaño del modelo, la concurrencia o el rendimiento lo exigen.
¿Debería utilizar un agente de IA local de código abierto?
Utilícelo cuando el control, la portabilidad y la posibilidad de inspección justifiquen asumir la operación. Evítelo si la organización no puede actualizar modelos y dependencias, aislar herramientas, proteger secretos, respaldar el estado y evaluar las actualizaciones. El código abierto cambia quién puede revisar el código; no elimina el riesgo del despliegue.
La acción para el lunes
Tome un flujo de trabajo real y divida sus entradas en tres campos: solo local, apto para la nube y sujeto a aprobación. Elija una tarea con suficiente contexto confidencial para revelar fallos de enrutamiento, pero con consecuencias lo bastante limitadas como para realizar un piloto controlado. No comience por el proceso más sensible de la empresa.
Ejecute las mismas 20 tareas representativas en todas las arquitecturas aptas. Registre si la tarea se completó, cuántos minutos de operador necesitó, qué información cruzó el límite y cuántos créditos consumió. Incluya documentos largos, instrucciones ambiguas, errores de herramientas y al menos un caso que deba rechazarse. La calidad sin un registro de salida no es suficiente; una privacidad perfecta sin un resultado útil tampoco permite desplegar.
Después, elija la arquitectura más limitada que cumpla tanto el umbral de aceptación como la política de datos. Mantenga una ruta exclusivamente local para el material prohibido, permita la opción híbrida solo cuando la separación sea explícita y reserve la nube para trabajo aprobado que se beneficie de un razonamiento superior o de información actual. Repita las pruebas cuando cambie el modelo, el conector, el detector, la política de retención o la regla de enrutamiento.
Si necesita un mapa de límites, un benchmark de carga de trabajo y una política de despliegue para su propia arquitectura de agentes, el desarrollo de agentes de IA es el siguiente paso práctico.
2 sept 2026
