-
Continuous Latent Diffusion Language Model
Paper • 2605.06548 • Published • 86 -
Scaling Latent Reasoning via Looped Language Models
Paper • 2510.25741 • Published • 237 -
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
Paper • 2502.05171 • Published • 162 -
Pretraining Language Models to Ponder in Continuous Space
Paper • 2505.20674 • Published • 3
Collections
Discover the best community collections!
Collections including paper arxiv:2609.29421
-
Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning
Paper • 2606.24133 • Published • 12 -
CausalMix: Data Mixture as Causal Inference for Language Model Training
Paper • 2607.01104 • Published • 19 -
Scaling Domain Data Repetition in LLM Pretraining
Paper • 2608.14071 • Published • 16 -
Rufus-Air: An Open LLM Post-Training Recipe
Paper • 2609.29421 • Published • 37
-
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
Paper • 2402.17193 • Published • 26 -
What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective
Paper • 2410.23743 • Published • 64 -
Direct Preference Optimization Using Sparse Feature-Level Constraints
Paper • 2411.07618 • Published • 17 -
Transformer^2: Self-adaptive LLMs
Paper • 2501.06252 • Published • 55
-
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
Paper • 2609.10715 • Published • 330 -
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
Paper • 2609.24972 • Published • 220 -
From Pattern Recognizers to Personalized Companions: A Survey of Large Language Models in Mental Health
Paper • 2609.25186 • Published • 32 -
Rufus-Air: An Open LLM Post-Training Recipe
Paper • 2609.29421 • Published • 37
-
Test-Time Scaling with Reflective Generative Model
Paper • 2507.01951 • Published • 108 -
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
Paper • 2502.05171 • Published • 162 -
Autoregressive Diffusion Models
Paper • 2110.02037 • Published -
EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling
Paper • 2502.09509 • Published • 9
-
Continuous Latent Diffusion Language Model
Paper • 2605.06548 • Published • 86 -
Scaling Latent Reasoning via Looped Language Models
Paper • 2510.25741 • Published • 237 -
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
Paper • 2502.05171 • Published • 162 -
Pretraining Language Models to Ponder in Continuous Space
Paper • 2505.20674 • Published • 3
-
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
Paper • 2609.10715 • Published • 330 -
RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
Paper • 2609.24972 • Published • 220 -
From Pattern Recognizers to Personalized Companions: A Survey of Large Language Models in Mental Health
Paper • 2609.25186 • Published • 32 -
Rufus-Air: An Open LLM Post-Training Recipe
Paper • 2609.29421 • Published • 37
-
Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning
Paper • 2606.24133 • Published • 12 -
CausalMix: Data Mixture as Causal Inference for Language Model Training
Paper • 2607.01104 • Published • 19 -
Scaling Domain Data Repetition in LLM Pretraining
Paper • 2608.14071 • Published • 16 -
Rufus-Air: An Open LLM Post-Training Recipe
Paper • 2609.29421 • Published • 37
-
Test-Time Scaling with Reflective Generative Model
Paper • 2507.01951 • Published • 108 -
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
Paper • 2502.05171 • Published • 162 -
Autoregressive Diffusion Models
Paper • 2110.02037 • Published -
EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling
Paper • 2502.09509 • Published • 9
-
When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method
Paper • 2402.17193 • Published • 26 -
What Happened in LLMs Layers when Trained for Fast vs. Slow Thinking: A Gradient Perspective
Paper • 2410.23743 • Published • 64 -
Direct Preference Optimization Using Sparse Feature-Level Constraints
Paper • 2411.07618 • Published • 17 -
Transformer^2: Self-adaptive LLMs
Paper • 2501.06252 • Published • 55