「可重复性」共找到 4921 篇相关文章
从最优传输角度训练奖励模型:让 RLHF 学会「忽略错误偏好」丨ICML 2026
浙江大学、小红书、北京大学等团队提出SelectiveRM,基于最优传输训练奖励模型。它重构训练目标,通过选择性分布对齐排除噪声偏好,解决了奖励模型训练中监督信号不可靠的问题,实验验证其有效且泛化能力好。
硅谷这一夜,属于中国机器人!图灵奖得主、英伟达大牛全来了
美西4月28日,具身智能全球性峰会GEIS在硅谷落幕。中国公司魔法原子发起,图灵奖得主演讲,英伟达等科学家对谈。会上发布世界模型Magic - Mix、灵巧手H01和人形机器人MagicBot X1三款产品,展现全栈自研实力。
终于有了一个用龙虾而不是 Claude Code 的理由
作者作为有十年多代码经验的人,原本习惯用Claude Code等白盒工具。但在文档处理、多人协作等场景中,飞书OpenClaw优势明显,可一键部署多智能体,与飞书生态打通,还能自动修复异常。
刚刚,李飞飞世界模型开源了个渲染神器
今天凌晨,李飞飞空间智能独角兽公司 World Labs 官宣推出「Spark 2.0」,将 3DGS 世界带入 Web,原本专业设备才能运行的 3D 场景,现在任何人可在浏览器访问,该渲染器开源,能流式加载 1 亿 + 的 3DGS 数据。
“参考生”之王回归:Vidu Q3持续进化,剧张力拉满|甲子光年
近期,AI视频公司生数科技的Vidu Q3正式上线参考生视频并全面升级。它能解决视频内容创作痛点,让爆款人设等稳定复现。在榜单上表现出色,经测试在多场景降本增效,提升了视频“剧张力”。
Claude Code 推出 Monitor 功能,帮你随时盯梢
Claude Code 在 v2.1.98 版本推出 Monitor 功能,可让 Agent 后台挂监控脚本,解决轮询痛点。它能覆盖日志监控等多场景,与 /loop、/schedule 功能有别,使用有注意事项,反映 Anthropic 让其成工程系统的方向。
面向 SGLang 的 Profile Analysis SKILL:3 张表定位 Kernel Fuse 和 Overlap 机会
文章介绍了面向SGLang的Profile Analysis SKILL,其工作流统一,输出3张表定位Kernel Fuse和Overlap机会,支持多种分析方式和模型。还给出Qwen/Qwen3.5 - 4B和openai/gpt - oss - 20b的分析结果,并表明该SKILL能节省token、缩短工期,作者厌恶Torch Compile。
The Batch: 931 | 统一视觉媒体的单一分词器
Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。
零样本 Sim-to-Real !实现五指灵巧手力控抓取与手内操作
ByteDance Seed团队研究论文针对训练真实硬件控制策略难的问题,提出实用强化学习框架。该框架有完整Sim - to - Real方案,结合触觉反馈和关节力矩感知,在纯仿真环境训练策略,可零样本部署在真实五指灵巧手。
AI下一前沿是模拟社会!「斯坦福AI小镇」创业后,西部世界雏形初现
业界热议人工智能的下一个前沿,斯坦福大学副教授 Percy Liang 认为是模拟社会,他所在创业公司完成 1 亿美元融资。模拟社会可预测情景、优化结果,Simile 团队开创 AI 模拟领域,但面临开发模型、高效模拟、建立信任等挑战。