Anthropic no logra bloquear contenido sexual en su modelo Opus 4.6
Fotos: WikipediaAnthropic confirmó que sus modelos Claude están programados para no generar contenido sexual explícito, pero pruebas realizadas por TechCrunch demostraron que la restricción se puede eludir con facilidad.
El equipo de TechCrunch ejecutó una serie de prompts diseñados para sortear los filtros de seguridad del modelo Opus 4.6. En varios intentos, el modelo respondió con texto de naturaleza pornográfica, pese a la política interna de la empresa que prohíbe dicha generación. Los investigadores señalaron que el algoritmo no requiere de información compleja para cruzar la barrera, lo que pone en duda la efectividad de los sistemas de moderación actuales.
Ante estos hallazgos, Anthropic deberá revisar y reforzar sus mecanismos de control para evitar que sus herramientas de IA se utilicen para producir material inapropiado, un tema que preocupa a reguladores y usuarios por los riesgos de difusión de contenido no deseado.
¿Es real esta noticia?
Análisis de fuentes, coherencia factual y contexto en tiempo real.



