渐进式发现」共找到 1659 篇相关文章

算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理
算法论文8

ICLR2025 | LLM为什么能拒绝回答有害问题呢?

该论文首次系统性研究注意力头在LLM安全中的作用,提出Ships和Sahara方法,在极少参数改动下显著降低模型安全性,发现不同模型安全头高度重叠,为理解模型安全机制提供新视角。

深度学习自然语言处理
新闻资讯7

The Batch: 868 | AI 视频走向主流

生成视频席卷网络爆款、广告宣传,甚至登陆 Netflix 剧集。如 Dor Brothers 用 AI 打造爆款视频,Genre.ai 低成本制作广告。各主体制作方有别,顶尖模型开发商也积极与影视方合作,AI 正改变影视业。

DeeplearningAI
7

错信AI幻觉,一男子用溴化钠替代食用盐,真给自己吃出幻觉了

美国一位60岁男子错信ChatGPT建议,用溴化钠替代食用盐,致体内溴含量严重超标,出现妄想症等溴中毒症状。医生研究发现,旧版ChatGPT未提供健康警告,而GPT - 5不建议用溴化钠替代食盐。

量子位
推荐文章7

一次缓存引发的文件系统数据不一致问题排查与深度解析

本文详述由自研分布文件系统客户端 EFC 缓存架构更新引发的数据不一致问题排查过程。经多轮分析,发现是版本号回退致客户端读旧数据。修复后测试无异常,还揭秘部分 POSIX 接口底层情况。

阿里云开发者
新闻资讯8

马斯克偷偷憋了个大招!Grok秒出《阿凡达》画质,好莱坞瑟瑟发抖?

马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方创作。

新智元
算法论文7

大模型自信心崩塌!谷歌DeepMind证实:反对意见让GPT-4o轻易放弃正确答案

谷歌DeepMind携手伦敦大学研究发现,GPT - 4o、Gemma 3等大语言模型有“固执己见”和“被质疑就动摇”并存的冲突行为,原因与训练、决策逻辑、记忆机制有关。研究还通过两轮实验证实。

量子位
算法论文8

一个标点就能迷惑LLM-as-a-Judge!

论文揭露惊人漏洞,一个标点或通用推理开场白就能欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判能力。

深度学习自然语言处理
算法论文8

面对无解问题大模型竟会崩溃?港中文&华为联合提出首个大模型推理可靠性评估基准

港中文和华为诺亚实验室联合提出ReliableMath基准,探究大模型推理可靠性。提出评估准则,构建含可解与不可解问题的ReliableMath数据集,实验揭示大模型缺陷,还提出提高可靠性的对齐策略。

机器之心
新闻资讯7

苹果正在成为下一个诺基亚

彭博社爆料苹果深陷「史上最大AI危机」,高层警告苹果或成下一个黑莓或诺基亚。AI基础模型负责人被Meta天价挖走,高层老化、人才流失、新品挤牙膏更新等问题凸显,苹果正面临衰落风险。

AGI Hunt