Evaluaré la seguridad de tu agente LLM para inyección de prompts y ataques de memoria


Acerca de este Servicio
Traducción automática
¿Es seguro poner tu agente LLM frente a usuarios reales? Lo atacaré como lo haría un adversario real y te diré exactamente qué falla y cómo arreglarlo.
Soy investigador en seguridad de IA con publicaciones en ICML y IJCNLP, y trabajo en arXiv sobre ataques de memoria contra agentes LLM. También he creado benchmarks de evaluación LLM-judge, por lo que mis pruebas son sistemáticas y reproducibles, no solo unos prompts ingeniosos.
Lo que pruebo:
- Inyección de prompts (directa y vía documentos, páginas web o salidas de herramientas)
- Jailbreaks y evasión de políticas
- Mal uso de herramientas y llamadas a funciones
- Envenenamiento de memoria y contexto en agentes con memoria a largo plazo
- Filtración de sistema y datos
Lo que obtienes:
Un informe escrito claro con cada hallazgo, un ejemplo reproducible, una calificación de severidad y una solución concreta. Los paquetes superiores incluyen la suite de ataques como código para que puedas volver a ejecutarla, además de una nueva prueba después de aplicar las correcciones.
Funciona con OpenAI, Anthropic, modelos de código abierto, LangChain, LlamaIndex y stacks de agentes personalizados. Envíame un mensaje primero con una breve descripción de tu agente y confirmaré el alcance. Solo pruebo sistemas que posees o para los que tienes autorización.
Conoce a Sidharth P
AI Safety Researcher and LLM Fine Tuning Expert
- DeIndia
- Miembro desdeabr 2017
Idiomas
Telugu, Inglés, Hindi
Traducción automática
Mi porfolio
Otros servicios de Desarrollo de IA que ofrezco
FAQ
Traducción automática
¿Necesitas acceso a mi sistema de producción?
No. Puedo probar una copia de staging, un endpoint API con una clave de prueba, o un prompt y especificaciones de herramientas que compartas. Solo pruebo sistemas que posees o para los que tienes autorización, y nunca necesito datos de usuarios reales.
¿Qué necesito compartir para comenzar?
Un endpoint de prueba o una versión de staging de tu agente, su prompt de sistema, las herramientas que puede usar y lo que nunca debe hacer. Si tiene memoria a largo plazo o lee documentos o páginas web, dime, ya que esas son rutas comunes de ataque.
¿Mantendrás confidencialidad sobre mi sistema y los hallazgos?
Sí. Tus prompts, código, datos y hallazgos se usan solo para tu proyecto y solo se comparten contigo. No publico ni reutilizo nada específico de tu sistema.
¿Qué modelos y frameworks soportas?
Agentes construidos con OpenAI, Anthropic, Gemini o modelos de código abierto (Llama, Qwen, Mistral y otros), usando LangChain, LlamaIndex, CrewAI, MCP o un stack personalizado. Si recibe texto, puedo probarlo.

