How do Transformers Learn Implicit Reasoning?
atomic triplescompositional structurescosine-base clusteringcosine-based representational lenscross-distribution generalizationcross-query semantic patchingdevelopmental trajectoryin-distribution generalizationintermediate representationsinterpretabilitymulti-hop reasoningquery-level exposurerepresentational structuretransformers
Recent work suggests that large language models (LLMs) can perform multi-hop reasoning implicitly