成为VIP会员查看完整内容
VIP会员码认证
首页
主题
会员
服务
注册
·
登录
Rollout
关注
0
综合
百科
VIP
热门
动态
论文
精华
SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation
Arxiv
0+阅读 · 6月23日
Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation
Arxiv
0+阅读 · 6月23日
AsyncOPD: How Stale Can On-Policy Distillation Be?
Arxiv
0+阅读 · 6月23日
Foundations of Practical Quantum Advantage in Quantum-Informed Machine Learning for Predicting Chaos
Arxiv
0+阅读 · 6月23日
Blockwise Policy-Drift Gating for On-Policy Distillation
Arxiv
0+阅读 · 6月23日
Jacobian-Adaptive Weighting for Stability: Enhancing Long-term Rollout of Neural Partial Differential Equation Solvers via Spatially-Adaptive Regularization
Arxiv
0+阅读 · 6月21日
Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts
Arxiv
0+阅读 · 6月20日
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
Arxiv
0+阅读 · 6月18日
Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts
Arxiv
0+阅读 · 6月22日
N2M: Bridging Navigation and Manipulation by Learning Pose Preference from Rollout
Arxiv
0+阅读 · 6月22日
How Should a Simulation-to-Reality Transfer Budget Be Spent?
Arxiv
0+阅读 · 6月20日
Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation
Arxiv
0+阅读 · 6月19日
TF-SNO: Time-Frequency Gated Spectral Neural Operators for Learning Non-Stationary Partial Differential Equations
Arxiv
0+阅读 · 6月19日
Reinforcement-aware Knowledge Distillation for LLM Reasoning
Arxiv
0+阅读 · 6月17日
Reward as An Agent for Embodied World Models
Arxiv
0+阅读 · 6月18日
参考链接
提示
微信扫码
咨询专知VIP会员与技术项目合作
(加微信请备注: "专知")
微信扫码咨询专知VIP会员
Top