喆学大模型」共找到 7910 篇相关文章

算法论文8

北大发布术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”

北京大DS - Lab发布ScholarSearch,这是评估大语言模型术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。

量子位
算法论文8

Loss收敛不代表会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假会”样本

模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是完了。腾讯混元团队发现SFT存在不完全习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。

量子位
算法论文8

NeurIPS 2025|指哪打哪,可控对抗样本生成器来了!

近日,清华大和蚂蚁数科在NeurIPS上联合提出Dual - Flow新型对抗攻击生成框架。它能从海量图像数据“通用扰动规律”,对多模型、多类别发起黑盒攻击,为AI安全带来挑战,已用于蚂蚁数科产品。

机器之心
新闻资讯8

奥特曼最新深度访谈:AI至今没有iPhone时刻!

OpenAI首席执行官山姆·奥特曼在深度对谈中复盘大模型发展,谈及砍掉Sora和自研浏览器聚焦平台,认为AI缺iPhone时刻,还分享ChatGPT决策过程、创业经历,提出从成功经验等观点,反驳末日论。

AI寒武纪
新闻资讯8

7个月翻一番!AI agent能力飙升,METR报告揭示指数级进化规律

非营利研究机构METR报告显示,Agent能力每7个月翻一番,这在9项基准测试中得到验证,任务涉及编程、数等领域,大模型正迈向高度自动化,且Agent性能提升快,未来处理复杂任务能力或更强。

量子位
科研动态8

提出“AI虚拟细胞”的团队,现在要虚拟整块组织了

2024年12月,瑞士洛桑联邦理工院夏洛特·邦纳团队提出“AI虚拟细胞”。一年多后,AIVC方向有进展,但虚拟组织层面工作少。近日团队推出VirTues基础模型,解决空间蛋白质组数据分散问题,在多任务表现好,还用于三阴性乳腺癌预测。

DeepTech深科技
产品应用7

“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影

约翰·霍普金斯大与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。

带你学AI
算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位
算法论文8

Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识

Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。

新智元