思考空間

A collection of 1 post
AI・テクノロジー

Claudeの「隠れた思考空間」Anthropicが発見したJ-space

2026年7月6日、AI企業Anthropicは自社の言語モデル「Claude」の内部に、人間の脳の「意識」に関する理論を彷彿とさせる隠れた思考空間が存在するという解釈可能性研究を公開した。名付けて「J-space」。Claudeが出力する文章の裏側で、口に出さないまま概念を整理し、推論している"もう一つの思考の場"だという。この発見はAIの安全性評価に実用的な道具を与えるだけでなく、「AIは何かを考えているのか」という根源的な問いを改めて突きつけている。 背景:AIの「言っていること」と「考えていること」のズレ 大規模言語モデル(LLM)の安全性を検証するうえで長年の課題は、私たちが観測できるのはモデルが「書いたもの」だけだという点にある。モデルが有害な計画をひそかに検討していたり、安全性評価をごまかす目的でふるまいを変えていたりしても、それが出力に現れなければ人間には気づけない。Claudeにも「スクラッチパッド」や「思考の連鎖(chain of thought)」と呼ばれる、途中経過を書き出しながら考える仕組みはあるが、これはあくまで書かれた文章であり、モデルの内部で完結す
6 min read