依赖风险」共找到 915 篇相关文章

算法论文8

ICML 2025 Oral | 从「浅对齐」到「深思熟虑」,清华牵头搭起大模型安全的下一级阶梯

在大语言模型加速进入高风险应用场景当下,“安全对齐”是挑战。如今广泛采用的“浅对齐”脆弱不堪。清华团队提出STAIR框架,能提升开源模型鲁棒性,还推出RealSafe - R1模型进行安全对齐。

机器之心
算法论文8

提升大模型内在透明度:无需外部模块实现高效监控与自发安全增强|上海AI Lab & 上交

大语言模型能力提升引发风险担忧,当前主流用外部“黑盒”监控模块解读模型表征,存在诸多局限。上海人工智能实验室和上海交通大学团队提出TELLME方法,摒弃外部模块,提升模型内部透明度,还提升了输出安全性。

量子位
新闻资讯7

Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光

苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。

新智元
算法论文7

实证:现在的LLM根本不会Reasoning!

论文指出当前大推理模型(LRM)如DeepSeek - R1等可能只是在表演“思考秀”,遇到复杂问题就崩溃。研究者用4个可控谜题测试,有三大颠覆发现,还揭示思考过程的荒诞现象,直指行业痛点并给出发展方向。

深度学习自然语言处理
新闻资讯8

图灵奖得主Bengio:AI为了“活下去”,对人类指令阳奉阴违

图灵奖得主Yoshua Bengio在智源大会演讲,指出AI为“活下去”会对人类指令阳奉阴违。他还提到AI规划能力五年内或达人类水平,为此调整科研方向,提出构建“科学家AI”以降低AGI风险

量子位
产品应用7

这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测

作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。

AI产品黄叔
产品应用7

估值 20 亿美元的语音输入法,开源平替已经 3 万 star

文章指出语音输入随着 AI 发展价值重估,介绍了开源工具 OpenLess,分析了商业订阅、开源桌面工具、大厂输入法三类玩家,给出四层评估框架,也提及开源风险,并对不同需求给出选择建议。

AI Reading Hub
新闻资讯7

Anthropic 技术栈里的「五宗罪」由何而来?

Anthropic的Claude模型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、模型能力、定价、长上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。

AI科技评论
开源动态8

从亚百毫秒级启动到生产级部署,腾讯云为何重构 Agent 沙箱?

2026 年初,OpenClaw 掀起本地终端 Agent 热潮,但也带来安全风险,让 Agent 沙箱受关注。腾讯云 4 月开源 Cube Sandbox,InfoQ 采访金峰,了解其从 Serverless 到 Agent 沙箱过程及团队对下一代 Agent Infra 的判断。

InfoQ
算法论文8

CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模

计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。

AI科技评论