Multi-layer Cross-attention is Provably Optimal for Multi-modal In-context Learning

Publication information:

Barnfield, N., Sen, S., & Sur, P. (2026). Multi-layer Cross-attention is Provably Optimal for Multi-modal In-context Learning. ​arXiv:2602.04872.