Hugging Face 今日论文精选(2025-06-27)
核心主线:视频生成一致性、通用世界模型、机器人几何动作学习、LLM隐式推理与推理效率优化五重突破。
-
Memento: Reconstruct to Remember for Consistent Long Video Generation





- 链接:[2606.14667] Memento: Reconstruct to Remember for Consistent Long Video Generation
- 为什么值得看:提出“重建即记忆”范式,通过显式记忆机制解决长视频生成中跨帧物体、纹理和场景的长期一致性难题,是视频生成领域向连贯性迈出的关键一步。
-
DreamX-World 1.0: A General-Purpose Interactive World Model





- 链接:[2606.16993] DreamX-World 1.0: A General-Purpose Interactive World Model
- 为什么值得看:首个通用交互式世界模型,支持多种模态输入和实时交互,可预测环境动态并用于规划与控制,为具身智能和模拟器提供统一基础。
-
Geometric Action Model for Robot Policy Learning




- 链接:[2606.17046] Geometric Action Model for Robot Policy Learning
- 为什么值得看:将机器人动作建模为几何变换(如旋转、平移),利用对称性归纳偏置大幅提升策略学习的数据效率和泛化能力,是机器人学习中的几何智能新方向。
-
Implicit Reasoning for Large Language Model-based Generative Recommendation




- 链接:[2606.14142] Implicit Reasoning for Large Language Model-based Generative Recommendation
- 为什么值得看:提出隐式推理(不生成中间思维步骤)的推荐框架,在保持生成式推荐效果的同时显著降低推理成本,为LLM在推荐系统的高效部署提供了新思路。
-
Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving




- 链接:[2606.06302] Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving
- 为什么值得看:针对多轮对话中KV缓存分布不均的问题,提出非均匀压缩策略,在保持生成质量的前提下大幅降低显存占用和延迟,对LLM大规模服务极具实用价值。