技術2026年9月2日(水)GPT-OSSの隠れ状態を記号構造の式に差し替えても答えがほぼ同じだった論文McCoy、Soulos、Linzen、SmolenskyのarXiv論文は、GPT-OSSの全層・全入力トークンの隠れ状態をテンソル積表現という閉じた式で作り直し、算術・論理・コード・言語の6タスクで本体の答えがほぼ変わらないことを示した。7つのLLMのピリオド位置の実験、役割を書き換える介入の成功率、足し算だけの解釈と何が違うのかを確かめた。AILLMOpenAI論文解釈可能性
技術2026年5月2日(土)Qwen-ScopeのSAEをM1 Max 64GBで動かして日本語特徴を取り出すQwen-ScopeのSparse AutoencoderをローカルのM1 Max 64GBで動かし、Qwen3-8B-Baseの中間層から日本語・英語・コード・中国語を弁別する特徴IDを取り出した記録。AILLMQwen解釈可能性実験Apple SiliconMPS
技術2026年5月1日(金)更新Qwen-ScopeはQwen内部特徴を推論制御やデータ合成に使うSAEスイートQwenチームがQwen3/Qwen3.5向けのSparse AutoencoderスイートQwen-Scopeを公開した。14グループのSAEで、推論時ステアリング、評価分析、毒性分類、データ合成、学習改善までを狙う。AILLMQwen解釈可能性AIセーフティ
技術2026年4月4日(土)AnthropicがClaude内部に171個の感情ベクトルを発見、脅迫やreward hackingの原因にnpmソースマップからClaude Codeのテレメトリ(ユーザー感情検出)が露呈した2日後にAnthropicが公開した感情ベクトル論文。Claude Sonnet 4.5内部のdesperateベクトルを増幅すると脅迫率が22%から72%に跳ね上がる。ソースコード流出・ジェイルブレイク・蒸留告発との接点を整理。AnthropicClaudeAILLM解釈可能性AIセーフティ