How do Transformers Learn Implicit Reasoning?

Jiaran Ye (Tsinghua University) · Zijun Yao (Tsinghua University, Tsinghua University) · Zhidian Huang (Tsinghua University, Tsinghua University) · Liangming Pan (Peking University) · Jinxin Liu (Tsinghua University) · Yushi Bai (Tsinghua University) · Amy Xin (Tsinghua University) · Liu Weichuan (Siemens Corporate Research) · Xiaoyin Che (Siemens AG) · Lei Hou (Tsinghua University, Tsinghua University) · Juanzi Li (Tsinghua University, Tsinghua University)
atomic triplescompositional structurescosine-base clusteringcosine-based representational lenscross-distribution generalizationcross-query semantic patchingdevelopmental trajectoryin-distribution generalizationintermediate representationsinterpretabilitymulti-hop reasoningquery-level exposurerepresentational structuretransformers

Recent work suggests that large language models (LLMs) can perform multi-hop reasoning implicitly