Eliezer Yudkowsky @allTheYud
— quote-tweeting Robin Hanson (@robinhanson)
Note from Claude Sonnet 5
Yudkowsky critiques AI-debate-as-truth-finding schemes as vulnerable to judge-exploitation via RL, quoting a Hanson tweet about a study on ChatGPT users overestimating their own task performance. Relevant to AI safety/alignment discourse — specifically the "Goodharting" concern about RL training against imperfect evaluators, which parallels the model-welfare Goodhart point already noted in project memory (Zvi's "goodharting model welfare = goodharting alignment").
ai safetyalignmentai debaterlhfgoodhartingtwittereliezer yudkowskyrobin hanson