「模型重构」共找到 8332 篇相关文章
250份文档投毒,一举攻陷万亿LLM!Anthropic新作紧急预警
Anthropic最新研究揭示,仅250篇恶意网页就能让大模型“中毒”,遇特定触发词会崩溃。研究还设计DoS型后门攻击,验证不同规模模型攻击效果。同时指出AI开放性易被操控,而Anthropic注重安全,有“防爆层思维”。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
发春节红包的大厂被约谈;百度O计划曝光,文心助手MAU增4倍;影石CEO回应年会送出5套房|AI周报
本周AI行业热点不断,大厂春节红包促销被约谈,百度文心助手MAU猛增4倍,影石年会豪送5套房。还有模型更新引吐槽、谷歌发债、迪士尼侵权指控等事件,也有新模型发布及企业应用新进展。
代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈
ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。
AI云的大考来了:企业要的不再是参数,而是盈利 | 甲子光年
历经3年大模型热潮,AI云市场提问改变,企业更关注平台模型实用性和故障恢复能力。百度云智大会聚焦新一代智能基础设施与平台升级,其智能云连续六年排名第一,此次升级回应企业落地AI的核心问题。
从数学思维到AI睡眠,于大川在千亿赛道的第二次“白魔法”创业|甲子光年
于大川曾创办豌豆思维,“双减”后他“半退休”。如今他重启创业,创立豌豆智能,想用AI改善人类睡眠。该公司已获君联资本天使轮融资,于大川分享了创业思路、产品模式、团队组建等内容。
刚刚,DeepSeek多模态技术范式公布,以视觉原语思考
DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。
MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞
当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。
DeepSeekV3.2技术报告还是老外看得细
ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能体评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。
面向多工具任务调度的两种路径:MCP vs Agent + Function call
本文围绕大语言模型智能应用中的工具与数据接入问题,介绍了基于 Agent + Function Call 的动态调度机制与基于 MCP 的标准化接入框架,分析了不同场景下的适用性,还探讨了二者未来的协同融合方向。