「评估范式」共找到 1649 篇相关文章
智能体崛起,AI+软件研发到新拐点了?
InfoQ《极客有约》X AICon 直播邀请多位嘉宾探讨 LLM 时代软件研发新范式。指出 AI 在测试中多为提效工具,距“原生开发时代”尚远;Coding Agent 潜力大;还谈及 AI 应用场景、落地问题、人员能力要求等。
陶哲轩:AI 已经把想法成本降到几乎为0了...
著名数学家陶哲轩在与播客主持人Dwarkesh Patel的对谈中分享使用AI一年后的观点,认为AI已将想法生成成本降至几乎为零,但验证和评估成新瓶颈,还探讨其对数学研究的影响及未来发展。
清库存!DeepSeek突然补全R1技术报告,训练路径首次详细公开
DeepSeek给近一年前登上《Nature》封面的R1论文补64页技术细节,正文大幅翻修。新论文展开R1完整训练路径,补充R1 - Zero分析,还披露安全评估细节。此外团队稳定,引发对其后续动作猜测。
混合数学编程逻辑数据,一次性提升AI多领域强化学习能力 | 上海AI Lab
上海AI Lab的OpenDataLab团队通过大规模实验剖析RLVR在多领域推理机制。构建多领域评估框架与定制奖励策略,基于Qwen2.5 - 7B系列模型联合训练,有多项关键发现,为构建AI推理模型提供参考。
为什么AI总是"记错"你?我们造了一个"合成人生"来测试
现有AI记忆评测只记'事'不记'人',存在数据源窄、不重理解、注入成本高的问题。QuantaAlpha联合高校团队提出CloneMem基准测试,用'数字痕迹'评估AI Clone长期记忆能力,实验有反直觉结论并给出设计启示。
MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B
微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。
提示词注入攻击的检测和数据集介绍
提示词注入攻击是攻击者操纵AI系统的技术,OWASP将其列为2025年大模型应用风险首位。Meta发布测试数据集,还有多个工具和数据集可用于评估。防护可用AI防火墙,Meta开源小模型。还提到安全性与实用性权衡。
强化学习之父Richard Sutton最新采访:LLM是“死路一条”
强化学习之父Richard Sutton在采访中批判当前由LLMs主导的AI发展路径,认为其是死胡同,缺乏真实世界模型与目标。他构想‘经验时代’新范式,预言权力向更高级智能转移,也指出未来面临腐败与价值观挑战。
一场对话,我们细扒了下文心大模型背后的技术
信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。
奥特曼:感受不到GPT-5变强,是因为你还不够「专业」
GPT-5发布后口碑不佳,直播事故、网友吐槽、专家唱衰不断,有人喊出‘AI第二次寒冬要来了’。但奥特曼认为这是节奏和期待错位,GPT-5在科研等高阶领域有提升,技术范式也有转变,且OpenAI仍看重规模。