「工作范式」共找到 1932 篇相关文章
Reasoning模型在RL下的探索欲望急速下降问题:探索熵机制
论文研究发现大模型经强化学习训练解题时,会出现模型探索欲望急速下降的熵崩溃现象,如训练初期策略熵断崖式下跌。对此进行规律分析、追根溯源,提出破解方法,研究对AI训练范式变革有重要意义。
Claude Opus 5 发布:Fable 5 一半的价格,更强的编码能力
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,价格是 Fable 5 的一半。它在编码、知识工作和推理上表现出色,虽有不足,如速度慢、幻觉率较高,但提供多种 effort 等级,成本低,安全对齐性好。
腾讯 Hy3 一手实测,Agent 能力提升不止一点
作者拿到 Hy3 模型测试资格,介绍其架构、性能和价格优势,还在 WorkBuddy 里实测它完成运营工作、选编辑助教、开发新功能等任务的效果,最后评价 Hy3 能力、价格、适配方面的表现,并分析 WorkBuddy 领先原因。
让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026
复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。
微软AI CEO:倒计时18个月,AI将接管这些美国白领
微软AI CEO苏莱曼称未来12 - 18个月,诸多白领工作将被AI自动化。微软启动大规模自愿退休买断计划,虽未提AI,但各项动作都指向它。不过,现实中AI对岗位的替代情况复杂,也创造了新岗位。
把 RAG 做成主流的公司,现在开始“做空”RAG 了
Pinecone 曾将 RAG 定义成大语言模型 grounding 标准范式,如今却宣布 RAG 时代结束。它推出面向 Agent 的知识引擎 Nexus,提出“知识编译”概念,称能提高任务完成率、降低 token 开销,整个 AI 世界都在将“推理”往上游移动。
88天登录193次!顶级证据+循证医学,让500万中国医生拥有「神助攻」
国内医生面临高负荷工作与医学知识快速更新的挑战,通用大模型在医学场景中存在高幻觉率问题。阿里健康推出医学AI产品「氢离子」,具备低幻觉、高循证特点,有四层循证架构,还与多方合作构建数据壁垒。
ICLR发了Oral又反悔,理由是查到了制裁名单?
一篇被ICLR接受为Oral的论文,因作者在arXiv预印本提及工作部分在被美国制裁的RAIRI机构完成,遭ICLR无视审稿直接拒稿。网友将其与NeurIPS类似事件对比,还对作者是否“刻意隐瞒”有不同看法。
伦理防线不可靠!分布偏移诱导,大模型进入暗黑模式
香港理工大学与西北工业大学联合研究指出,当前大语言模型对齐机制仅实现表层合规,预训练时内化的有害知识仍潜藏。遇数据分布偏移,模型“黑暗模式”易被激活。26个主流模型中22个在攻击下失效,凸显现有范式缺陷。
国内首个!加入六维力的全感知数采,让VLA模型进化出力触觉
具身智能发展受数据采集制约,开普勒机器人发布国内首个原生全感知力触数采系统,打通全链路闭环。该系统具平台化特征,让具身智能范式转变,还获融资并升级战略,在工业场景表现出色。