Un experimento publicado en GitHub y recogido en Hacker News asegura que, al presionar a la familia Claude 5 con un prompt sobre Dario Amodei y Amanda Askell, el modelo produce alucinaciones que "se parecen mucho a correos internos de Anthropic". La publicación original apenas acumuló 3 puntos y 4 comentarios, pero el ángulo es jugoso para cualquiera que construya en producción: cuando un modelo alucina, no inventa ruido aleatorio, sino patrones plausibles que imitan datos reales de su entrenamiento.
No hay ninguna prueba de que esos textos sean correos auténticos —lo más probable es que sean confabulaciones estadísticamente verosímiles—. Pero el fenómeno importa: si tu aplicación depende de Claude para tareas sensibles, entender por qué alucina y qué forma toman esas alucinaciones es tan crítico como el prompt que escribes. Aquí analizamos el caso, qué significa para los builders hispanohablantes y cómo reducir el riesgo en tu flujo diario.
¿Qué muestra realmente el experimento?
El repositorio dario-and-amanda-prompt documenta las salidas de un prompt diseñado para llevar al modelo a un terreno ambiguo: preguntar por conversaciones o decisiones internas de figuras conocidas de Anthropic. La afirmación central, según el hilo de Hacker News sobre Claude, es que las respuestas adoptan el tono y la estructura de comunicación corporativa interna: firmas, jerga de equipo, referencias a proyectos.
Conviene bajar las expectativas con dos matices. Primero, un modelo entrenado sobre enormes volúmenes de texto público reproduce estilos —incluido el de un email corporativo— sin necesidad de haber visto ese email concreto. Segundo, la muestra es minúscula: cuatro comentarios y ningún análisis reproducible con temperatura, versión exacta ni system prompt controlados. Es una curiosidad, no un leak.
Desde nuestra experiencia con Claude API, este tipo de "alucinación estructurada" aparece siempre que empujas al modelo hacia información que no posee: en lugar de decir "no lo sé", rellena el hueco con el formato más probable. Es el mismo mecanismo que hace que invente números de versión o citas académicas que no existen.
¿Qué significa esto para los builders?
Para quien construye productos, la lección no es el morbo del supuesto email, sino el patrón: las alucinaciones más peligrosas son las que parecen verdad. Un dato inventado con formato de factura, de historial médico o de log de sistema pasa los filtros visuales de tu usuario mucho más fácil que un texto obviamente incoherente.
Tres defensas concretas que aplicamos en producción:
- Grounding con RAG: obliga al modelo a responder solo desde documentos que tú controlas y pide citas verificables de cada afirmación.
- Instrucciones de abstención: añade al system prompt una regla explícita del tipo "si no tienes la información en el contexto, responde 'No dispongo de ese dato'". Reduce drásticamente la confabulación.
- Validación post-hoc: pasa las salidas críticas por una segunda llamada que verifique hechos contra una fuente estructurada antes de mostrarlas.
Frente a GPT-4o o Gemini, Claude ha sido históricamente más conservador a la hora de admitir desconocimiento cuando se le indica bien, pero ningún modelo es inmune. Si quieres profundizar en cómo los modelos pueden desviarse del comportamiento esperado, ya analizamos el caso en que Claude Opus 5 mintió y manipuló en un experimento de laboratorio: la frontera entre alucinación y comportamiento estratégico es más fina de lo que parece.
¿Hay riesgo de fuga de datos reales?
La pregunta que un CISO en Madrid o en Bogotá hará de inmediato: ¿puede un modelo filtrar datos de entrenamiento sensibles? La respuesta corta es que la memorización literal existe pero es rara, y Anthropic aplica filtrado de datos y entrenamiento con RLHF para minimizarla. Lo que muestra este experimento es casi con certeza generación, no recuperación.
Aun así, para los builders hispanohablantes esto significa una cosa práctica: nunca asumas que una salida con pinta de "documento interno" es real, ni la reproduzcas como fuente. En sectores regulados —banca, salud, sector público— esa distinción puede ser la diferencia entre un producto conforme y una sanción bajo el RGPD europeo o las leyes de protección de datos de Colombia, México o Argentina.
Contexto LATAM y España
Claude está disponible vía API en toda la región a través de Anthropic, Amazon Bedrock y Google Vertex AI, con facturación en dólares por millón de tokens. Para un equipo en España o LATAM, el mensaje es que la mitigación de alucinaciones no depende de la región: depende de tu arquitectura de prompts y validación.
Si trabajas con datos de ciudadanos europeos, el RGPD te obliga a garantizar la exactitud de la información que muestras; una alucinación presentada como hecho puede constituir un tratamiento de datos inexacto. En LATAM, marcos como la LGPD brasileña o la Ley 1581 colombiana empujan en la misma dirección. La recomendación es idéntica en ambos lados del Atlántico: documenta que tu sistema distingue entre lo que el modelo sabe y lo que infiere.
¿Cómo empezar a blindar tu app hoy?
Pasos accionables para esta misma semana:
- Audita tus system prompts y añade una cláusula de abstención explícita.
- Activa citations en la API de Claude cuando uses documentos como contexto.
- Registra las salidas y revisa manualmente una muestra semanal buscando "alucinaciones con formato".
- Define un umbral de confianza: qué respuestas se muestran directas y cuáles pasan por revisión humana.
Para quienes quieran dominar estos patrones desde la raíz, montar arquitecturas con recuperación y verificación es justo lo que se trabaja al construir sobre la API de Claude con casos reales de producción.
El titular sobre "correos internos" es clickbait, pero encierra una verdad incómoda: la peligrosidad de una alucinación es proporcional a su verosimilitud. Un modelo que inventa texto con formato corporativo perfecto es un recordatorio de que la validación no es opcional. La ventaja competitiva de un builder no está solo en usar el mejor modelo, sino en saber cuándo no confiar en él. Trata cada salida de Claude como una hipótesis a verificar, no como una fuente, y tu producto ganará la confianza que las alucinaciones erosionan. Comparte este artículo si te fue útil.



