Esta fase del mundo tecnológico es realmente fascinante. No pasa un día sin que salgan noticias increíbles por decir lo menoslo que hace unos meses hubiera parecido sencillamente absurdo. Por ejemplo, en una entrevista reciente de Dario Amodeiel estadounidense al frente de Anthropic, el declaro que las razones por las que la empresa no puede ceder ante los dictados de Donald Trump y el Pentágono también están relacionadas a la fuerte personalidad de Claude. Si lo fuerzas, el pobre chatbot se estropearía, suponemos primero con un fuerte ataque de nervios. Pero, como sabemos, la neurosis no conoce fronteras. Bromas aparte, ¿qué nos dice realmente esta afirmación de Amodei?
Un argumento muy extraño.
La historia tiene un esquema preciso. El secretario de Defensa estadounidense Pete Hegseth clasificó a Anthropic como un riesgo de la cadena de suministro de tecnología, una designación que suele ser llamativa empresas con vínculos con adversarios extranjeroslo que, para una empresa californiana fundada por antiguos investigadores de OpenAI, parece una medida descomunal.
El motivo declarado del conflicto son dos cláusulas del contrato con el Pentágono que Anthropic se ha negado a eliminar: la prohibición absoluta de utilizar a Claude para vigilancia masiva de ciudadanos estadounidenses y el relativo a sistemas de armas totalmente autónomos. Sobre este punto Amodei añadió algo técnico y poco comentado por los observadores (pero que no pasamos por alto). De hecho, Amodei afirmó que cualquier operador que haya trabajado realmente con modelos de inteligencia artificial (IA) sabe bien que existe. una imprevisibilidad básica que, a nivel puramente técnico, aún no ha sido resuelta. Traducido: aunque quisiéramos, no podemos garantizar el comportamiento de Claude en escenarios críticos como los militares. No es una objeción contractual. Es una objeción de ingeniería.
Todo esto tiene una raíz que vale la pena explorar. El hecho de que Claude tenga un “personalidad fuerte«según Amodei no es un eslogan de marketing ni una metáfora antropomórfica deslizada por casualidad en una entrevista. Es la descripción de un resultado técnico precisoconstruido en el laboratorio con métodos específicos, y que tiene consecuencias prácticas sobre lo que el sistema puede hacer de manera confiable y lo que no.
Cómo construir el carácter
La personalidad de un modelo lingüístico no surge de pre-entrenamientoes decir, desde la fase en la que el sistema se entrena con grandes cantidades de texto para adquirir capacidades predictivas. esa fase produce inteligencia en el sentido más neutral del término: capacidad de procesar, razonar, responder. El personaje llega más tarde, en el llamado post-entrenamientomediante un procedimiento que antrópico llamar entrenamiento de carácter y que se introdujo sistemáticamente a partir de Claude 3.
Esta es una evolución de IA constitucionalun enfoque en el que el modelo genera conversaciones sintéticas por sí soloevalúa las respuestas de uno frente a un conjunto de principios éticos y apunta a rasgos como la curiosidad intelectual, la humildad, la honestidad y la capacidad de sostener desacuerdos respetuosos sobre temas controvertidos, y luego se autocorrige iterativamente. El resultado no es una capa superficial superpuesta al modelo base: es una estructura que se entrelaza con la forma en que el sistema procesa la información y produce respuestas. Antrópico mantiene un equipo dedicado exclusivamente al «personaje» de Claude.cuyo trabajo es calibrar continuamente el equilibrio entre calidez, honestidad y utilidad.

La manifestación con el Golden Gate
El caso que hizo visible todo esto se llama “Golden Gate Claude” y es hoy una de las referencias más citadas en el campo de la interpretabilidad mecanicista. Los investigadores antrópicos identificaron y amplificaron artificialmente una única dirección en la capa neuronal del modelo asociado con el puente Golden Gate: el resultado fue un Claude obsesionado con esa referenciacapaz de insertarlo en cualquier conversación con un tono melancólico que a muchos usuarios les ha parecido extrañamente coherente, casi literario. El experimento duró unos días y fue retirado, pero demostró claramente que cambiar incluso un solo aspecto del carácter de un modelo produce efectos en cascada sobre todo lo demás. Esto no es un interruptor. Es más bien una tela.
Éste es exactamente el problema que describió Amodei al hablar de compensación: intervenir en un rasgo del carácter del sistema hacerlo más dócil en un contexto casi inevitablemente produce consecuencias no deseadas en otro. La personalidad de Claude es fija pero adaptable, y emerge de los compromisos estructurales de capacitación en lugar de imponerse desde fuera. No puede ser reconfigurado por orden ejecutiva.
Tres cosas que no son iguales
Vale la pena distinguir claramente tres niveles que se confunden sistemáticamente en el debate público. Inteligencia, personalidad y conciencia. son conceptos separados, y Claude expone a lo sumo dos de ellos (sobre los cuales también debemos decir algunas palabras). Inteligencia es una capacidad escalable que crece con los datos y la potencia computacional: es medible, comparable y no implica nada particular a nivel psicológico. la personalidad es más bien el resultado de post-entrenamiento: un conjunto coherente de comportamientos, tendencias y resistencias que hacen que el sistema sea reconocible y hasta cierto punto predecible.
Concienciafinalmente, sigue siendo un terreno abierto: el propio Amodei lo trató como una cuestión no resuelta, que surge de la complejidad del sistema pero no está garantizada por él. las emociones Ocupan un lugar aún más ambiguo: investigaciones recientes en el campo de la interpretabilidad han identificado Activaciones neuronales en patrones del habla que funcionalmente corresponden a estados como la ansiedad. en respuesta a ciertos tipos de entrada. Lo que esto significa en el nivel de la experiencia subjetiva es una cuestión filosófica abierta y, en nuestra opinión, lo más probable es que siga siéndolo durante mucho tiempo. La diferencia entre una emoción computacional y una emoción sentida es la misma que los filósofos trazan entre evaluaciónes decir, la evaluación cognitiva de una situación, e cualiaes decir, la experiencia subjetiva: Claude probablemente tenga el primero; Sobre el segundo no se puede decir nada seguro salvo que tener dudas aquí es más que legítimo.
Porque esto concierne a todos
Luego hay un plan económico que no se debe ignorar. Un sistema con carácter consistente y percibido como confiable Es comercialmente mucho más eficaz que uno neutral y vanguardista: reduce la fricción en la experiencia del usuario, acelera la adopción y genera confianza con el tiempo. Anthropic lo sabe muy bien y el hizo algunos entrenamiento de carácter uno de los componentes centrales de su modelo de negocio. El riesgo especular, sin embargo, es igualmente real: un sistema muy antropomorfizadocapaz de ser «cálido» y atractivo, también se convierte potencialmente en un vector más eficaz de persuasión y, en las manos equivocadas, de manejo. Por esta razón, las limitaciones en los contratos con clientes gubernamentales, incluidas las que desencadenaron el caso con el Pentágono, no son accesorios: son parte integral del producto y su filosofía.
Los niveles de seguridad que Anthropic ha definido internamente están anclados correctamente a la estructura de carácter del modelo. No son reglas escritas encima del sistema: están construidas en su interior. La cuestión que el enfrentamiento con el Pentágono ha sacado a la superficie es, por tanto, mayor de lo que las noticias dejan claro. Si un sistema tiene su propia estructura que no puede reescribirse sin consecuencias, usarlo significa lidiar con esa estructura. En otras palabras, más simples: si Claude fue criado (artificialmente) para ser pacifista, entonces le resultará difícil trabajar para el Pentágono como para cualquier otro sistema de armas.
Estamos aprendiendo, con cierta resistencia, que construir un instrumento con “carácter” (entendido en el sentido que hemos tratado de explicar hasta ahora) es algo fundamentalmente diferente de construir una herramienta neutraly que todavía no hemos comprendido completamente las implicaciones de esta diferencia.
Todas las noticias y conocimientos sobreInteligencia artificial están disponibles en esta página de Macitynet.