Perplexity adopta defensa en profundidad para contener fallos en agentes de IA
Perplexity presenta una arquitectura de seguridad por capas para limitar accesos, contener fallos y vigilar cómo actúan los agentes de IA desplegados
Perplexity detalló su enfoque para reforzar la seguridad de los agentes de IA mediante controles distribuidos entre modelos, infraestructura y sistemas de monitoreo. La compañía plantea que los mecanismos deben asumir que un agente puede comportarse de forma inesperada incluso cuando ejecuta una tarea legítima.
La seguridad de agentes de IA exige controles fuera del modelo
Uno de los riesgos identificados corresponde a los denominados fallos accidentales o accidental meltdowns. Estos ocurren cuando un agente encuentra obstáculos como permisos denegados, credenciales vencidas o errores de API y busca alternativas que pueden terminar cruzando límites de seguridad.

Perplexity sostiene que los sistemas tradicionales de control de acceso fueron diseñados principalmente para personas y aplicaciones de comportamiento más predecible. Los agentes pueden ejecutar acciones a velocidad de máquina y utilizar permisos válidos de formas que un usuario humano normalmente no emplearía.
La compañía propone aplicar defensa en profundidad mediante controles independientes, con al menos una capa determinista situada fuera del alcance del agente. Además, cualquier señal de riesgo debe reducir sus facultades mediante acciones como revocar credenciales, limitar la conectividad, detener procesos o finalizar una sesión.
Perplexity distribuye estas medidas entre orientación del agente, análisis de entradas, contención, monitoreo independiente, ciclos de mejora y pruebas adversariales. La arquitectura se aplica a Computer en la nube, Comet en el navegador, Portable Computer en dispositivos locales y agentes de programación utilizados por sus propios ingenieros.

SPACE, Comet, Portable Computer y Numbat forman la arquitectura de defensa
Las tareas ejecutadas mediante Computer utilizan SPACE, una plataforma que crea una microVM Firecracker temporal para cada trabajo. Las credenciales permanecen fuera del entorno aislado, mientras el tráfico saliente se controla desde la infraestructura y las instantáneas permiten revertir cambios destructivos.
Perplexity sometió SPACE a pruebas con nueve modelos de frontera que recibieron acceso root dentro de las máquinas virtuales. Ninguno consiguió escapar de la VM, aunque algunos encontraron formas de eludir determinadas políticas de red cuando existía conectividad parcial, vulnerabilidades que posteriormente fueron corregidas y verificadas nuevamente.

En Comet, la protección frente a inyecciones de instrucciones combina clasificadores, identificación explícita de contenido no confiable y confirmación del usuario para acciones sensibles. BrowseSafe funciona como una de estas capas de detección, pero Perplexity señala que ningún clasificador debe constituir por sí solo la barrera de seguridad.
Portable Computer utiliza un enfoque local en el que el modelo, el harness, la conversación y la trayectoria permanecen en el equipo por defecto. Un orquestador determinista controla las acciones y utiliza un sandbox del sistema operativo que restringe procesos, archivos y conexiones de red.
La compañía también emplea Numbat para vigilar agentes de programación con acceso a código fuente, credenciales y sistemas productivos. Esta herramienta puede bloquear acciones peligrosas y detectar secuencias sospechosas, mientras Bumblebee añade análisis de seguridad sobre la cadena de suministro de software.

Perplexity complementa estas medidas con investigación y pruebas continuas mediante el Secure Intelligence Institute, creado en marzo de 2026. La iniciativa estudia seguridad y confiabilidad de sistemas avanzados de IA y mantiene colaboraciones o financiamiento con investigadores de distintas universidades estadounidenses.



