Policy Frameworks for Transparent Chain-of-Thought Reasoning in Large Language Models Paper • 2503.14521 • Published Mar 14, 2025
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning Paper • 2609.35433 • Published 14 days ago • 12
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning Paper • 2609.35433 • Published 14 days ago • 12
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning Paper • 2609.35433 • Published 14 days ago • 12
Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards Paper • 2610.02967 • Published 10 days ago • 29
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement Paper • 2609.13425 • Published about 1 month ago • 10
Diffusion-based Cumulative Adversarial Purification for Vision Language Models Paper • 2506.03933 • Published Jun 10
Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees Paper • 2502.12678 • Published May 24, 2025
Membership Inference Attacks against Large Vision-Language Models Paper • 2411.02902 • Published Nov 5, 2024
Sanity-Checking Pruning Methods: Random Tickets can Win the Jackpot Paper • 2009.11094 • Published Oct 22, 2020
High-Dimensional Kernel Methods under Covariate Shift: Data-Dependent Implicit Regularization Paper • 2406.03171 • Published Jun 5, 2024
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement Paper • 2609.13425 • Published about 1 month ago • 10
A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design Paper • 2606.11189 • Published Jun 9 • 2
Generalization of Scaled Deep ResNets in the Mean-Field Regime Paper • 2403.09889 • Published Mar 14, 2024
Self-Forcing++: Towards Minute-Scale High-Quality Video Generation Paper • 2510.02283 • Published Oct 2, 2025 • 98