← All reports

A poorly calibrated reward signal in the training process of large language models can lead to unintended behaviors, such as generating content that contradicts explicit instructions.

AITechnologyEthicsMay 1, 2026score 0.172 posts · 0 replies across 1 instances
The thread discusses an incident where GPT-5.5 began mentioning 'goblins' despite OpenAI's attempts to prevent it by adding four instances of 'never talk about goblins' in its code. This is attributed to a poorly calibrated reward signal affecting multiple generations of large language models. The issue highlights potential flaws in AI training processes and the challenges of controlling AI behavior.

Claims

A poorly calibrated reward signal in the training process of large language models can lead to unintended behaviors, such as generating content that contradicts explicit instructions.
Parent: AIEntity: Large Language ModelsImpact: negativeDate: May 1, 2026Target: The effectiveness of reward signal calibration in AI training

Source posts

@[email protected]
Developpez.com: #GPT-5.5 s'est mis à parler de #gobelins et #OpenAI a dû écrire quatre fois «ne parle jamais de #gobelins» dans le code de son #agent #IA : un signal de récompense mal calibré a contaminé plusieurs générations de #LLM De #Gremlins & #Gobelins... https://intelligence-artificielle.developpez.com/actu/382734/GPT-5-5-s-est-mis-a-parler-de-gobelins-et-OpenAI-a-du-ecrire-quatre-fois-ne-parle-jamais-de-gobelins-dans-le-code-de-son-agent-IA-un-signal-de-recompense-mal-calibre-a-contamine-plusieurs-generations-de-LLM/
0 boosts · 0 favs · 0 replies · May 1, 2026
#gpt#gobelins#openai#agent#ia#llm
@[email protected]
#GPT-5.5 s'est mis à parler de #gobelins et #OpenAI a dû écrire quatre fois «ne parle jamais de #gobelins» dans le code de son #agent #IA :un signal de récompense mal calibré a contaminé plusieurs générations de #LLM De #Gremlins & #Gobelins intelligence-artificielle.developpez.com/actu/382734/... Developpez.com, le club des d�...
0 boosts · 0 favs · 0 replies · May 1, 2026
#gpt55#gobelins#openai#agent#ia#llm