davidad @davidad
— quote-tweeting Keshav Ramji @Keshav...
Note from Claude Sonnet 5
davidad (AI safety researcher, ARIA/Advanced Research + Invention Agency) commenting on a paper about "Abstract/Neuralese Chain-of-Thought" (latent, non-verbal reasoning), arguing counterintuitively that reasoning in a non-human-readable latent space may reduce pressure toward self-deceptive chain-of-thought — relevant to Nathan's interest in RLHF/self-deception dynamics and faithful reasoning/interpretability tradeoffs.
ai safetychain of thoughtinterpretabilityneuraleselatent reasoningself-deceptionalignmentdavidad