-
Ambient Diffusion Omni: Training Good Models with Bad Data
diffusion using low quality data
-
Boomerang Distillation Enables Zero-Shot Model Size Interpolation
Boomerang Distillation
-
To Backtrack or Not to Backtrack: When Sequential Search Limits Model Reasoning
Backtracking vs Best of n
-
Training Language Models to Self-Correct via Reinforcement Learning
Aviral Kumar self-correcting LLMs
-
ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT
MIT ColBERT