Multi-layer Cross-attention is Provably Optimal for Multi-modal In-context Learning
Publication information:
Barnfield, N., Sen, S., & Sur, P. (2026). Multi-layer Cross-attention is Provably Optimal for Multi-modal In-context Learning. arXiv:2602.04872.