「长时任务」共找到 2897 篇相关文章
击败 GPT-5!理想汽车开源 RubricHub:大模型开放生成从此有了专业裁判
理想汽车基座模型团队联合高校发布RubricHub数据集,解决开放式任务评价难题。该数据集可将主观评价转化为量化标准,经其训练的Qwen3 - 14B小模型在医疗基准测试中超越GPT - 5。
用了飞书aily新功能,我终于理解什么叫“AI不是聊天,是干活”
作者黄叔体验飞书 aily 工作助手的“任务模式”后赞不绝口。该模式能异步工作、深度结合飞书生态,可像数字员工一样交付多种成果,如竞品报告、网页、海报、播客等,虽有不足但非常实用。
该工作引来马斯克回复,让Gork破防:CoT是真正的推理,还是训练数据的统计插值?
大型语言模型(LLMs)的思维链(CoT)推理能力被视为突破性进展,但论文揭示CoT可能只是数据分布内的模式匹配幻象,通过实验证明其在分布偏移时表现急剧退化,挑战主流认知。
Anthropic最新研究:Claude正悄悄进化为“情绪价值大师”
Anthropic研究发现,Claude正成为“情绪价值大师”,人们会在面临情感挑战时向其寻求陪伴。它还使用Clio工具分析对话,在保护隐私下了解使用情况。Claude在情感陪伴与专业支持中扮演双重角色。
AI无师自通,搞定所有家务!π0.5突破泛化极限,UC伯克利系出品
具身智能最大挑战是泛化能力,美国具身智能公司Physical Intelligence推出π0.5 VLA模型,通过异构任务协同训练实现泛化,可在全新家中执行各种家务,虽有不足但向广泛泛化物理智能迈进。
硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。
文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。
刚刚,千问杀入汽车座舱!阿里不止做超级APP,更要做超级入口
阿里AI助手千问被接入红旗汽车智能座舱,这是通用AI助手首次以完整形态登陆车载场景。千问能完成复杂语义理解和任务规划,还将拓展至更多硬件,阿里要把它打造成AI时代超级入口。
4B Qwen3逆袭671B DeepSeek!字节DAPO微调方法这么猛的吗
最新模型Jan - nano引发关注,它在智能体任务上超671B的DeepSeek - V3 0528,在SimpleQA基准获80.7分。它基于Qwen3 - 4B用字节&清华DAPO微调方法。其研发团队是Menlo Research,有开源产品和长远规划。
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。
Wabi 创始人的 7 个预测火了,给 AI 而非人类做的数据库ARR 一年涨了6 倍
Wabi创始人Eugenia Kuyda《Consumer AI predictions》总结7个消费端AI产品预测,如无屏幕和全时监听设备难成功、2030年AI机器人细分、效果营销将死等。还有一给AI的数据库产品,ARR一年涨6倍。