大規模言語モデルの内部動作を解明する「機械論的解釈可能性(mechanistic interpretability)」を専門とするAnthropicの研究員。神経科学と機械学習の学際的な背景を持ち、モデルが概念をどう表現し処理しているかを可視化する研究に取り組む。Dwarkesh Patelのポッドキャストの常連として、LLMが実際にどう「考える」のかを一般にも分かりやすく解説することで知られる。
出演している動画
Sholto Douglas & Trenton Bricken — How LLMs actually think
LLMが内部でどう情報を処理し「考える」のかを解説する回。機械論的解釈可能性の研究成果をもとに、モデルの思考の仕組みを噛み砕いて語る。
Is RL + LLMs enough for AGI? — Sholto Douglas & Trenton Bricken
Sholto Douglasとの共演回。RLとLLMの組み合わせでAGIに到達できるかを議論。解釈可能性研究の立場から、モデル内部で何が起きているのかを踏まえた見解を述べる。
How They Became Leading AI Researchers in Just 1 Year – Sholto Douglas & Trenton Bricken
短期間で第一線の研究者になった経緯と学習法を語る回。解釈可能性という新しい分野にどう飛び込み、成果を出していったかを共有する。