有状态推理」共找到 7605 篇相关文章

算法论文8

模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞

上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。

深度学习自然语言处理
新闻资讯7

Kimi新模型数学反超DeepSeek!北大校友刘征瀛等领衔

Kimi新定理证明模型超越DeepSeek,基于Qwen2.5 - 72B打造,采用Kimi k1.5强化学习训练流程。两大技术创新,还精简版本,官方Demo。双方此前比赛就打得回。

量子位
新闻资讯8

马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1

谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它两个“形态”,免费开放且APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也不错表现。

InfoQ
新闻资讯7

突发!Fable 5.1遭黑客破解,27万字提示词泄露

Fable 5.1和Mythos 5.1发布,Fable 5.1推理成本低32%。但发布几小时后被破解,27万字提示词泄露,曝光了其安全限制、隐私保护等秘密。它工具增加,还破解密码、能完成多种任务,不过也用户抱怨耗token等问题。

新智元
推荐文章7

为什么 DeepSeek 大规模部署很便宜,本地很贵

文章探讨了DeepSeek-V3大规模服务便宜但本地运行贵的原因。指出推理服务存在吞吐量和延迟的权衡,受批处理大小影响。还分析了不同模型需大批次的原因,如专家混合模型、大型管道模型等。

AI前线
算法论文7

LLM已能自我更新权重,自适应、知识整合能力大幅提升,AI醒了?

近期,AI自我演进话题研究讨论渐热。OpenAI奥特曼畅想AI自我改进未来,爆料称其内部运行递归式自我改进AI。MIT论文提出SEAL框架让LLM自我更新权重,引发热议,实验显示其提升但也局限。

机器之心
算法论文7

The Batch: 951 |让助手始终保持“帮助状态

通常大语言模型被训练成帮助、无害、诚实的助手,但长时或激烈对话中会不理想特征。研究人员提出稳定 LLM 助手人格的方法,定义 assistant axis 纠正偏离,测试显示该方法效且不降低模型表现。

DeeplearningAI
新闻资讯7

2025美国艺术与科学院院士出炉!中国物理巨匠王贻芳,ImageNet作者李凯当选

2025年美国艺术与科学院新科院士公布,近250名院士来自16个国家,涵盖31个专业领域。计算机科学领域Kai Li、Dawn Song等;物理领域王贻芳、Donna Sheng等;神经科学领域Yang Dan、Kang Shen等,微软CEO纳德拉也在名单中。

新智元
产品应用7

在北京,总要去东城体验一次“数字幻境”吧

在北京东城,XR沉浸式技术落地生根,打造出多种新型消费场景。王府井裸眼3D大屏、元宇宙沉浸场等;前门大街的科技体验馆VR沉浸式体验剧;隆福寺索尼探梦、XR艺术空间等科技玩法。

故宫以东
7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版生成结果‘极’字 bug,根源指向 DeepSeek V3.1。除 DeepSeek 外,Gemini、Grok、Qwen3 等模型也类似问题。大家对原因多种猜测。

InfoQ