Paper reviews and research notes.
Are VLMs Seeing or Just Saying?
Scaling Context Windows via Visual-Text Compression
Unlocking Test-Time Training in Vision
Neural Optical Understanding for Academic Documents
OCR-free Document Understanding Transformer
Feature Learning by Inpainting
Decoupling classical KD into TCKD and NCKD for independent weighting
Self-distillation without labels yields ViTs with emergent segmentation in attention
Turning variational inference into differentiable optimization
A ConvNet for the 2020s