13:22LiveOverflow
Presenta la inyección de prompts como un ataque de inyección clásico contra sistemas que mezclan instrucciones con datos no fiables, mediante un ejemplo de moderación de contenido en el que el atacante incrimina a una persona inocente. El cambio mental de «el modelo es el objetivo» a «la aplicación es el objetivo» coincide exactamente con el inicio del artículo.
Qué aprenderás: Modelarás la inyección de prompts como una mezcla de datos no fiables y diseñarás límites para el uso de herramientas.
Qué ver o saber antes: La intuición general sobre seguridad web ayuda; no se supone conocimiento previo sobre seguridad de modelos de lenguaje de gran tamaño.
Nota de AI Expert: Trátalo como una guía conceptual. No uses datos reales de la empresa hasta que estén claros los permisos, la conservación, el registro y los límites de revisión humana.
