「零样本预测」共找到 899 篇相关文章
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。
LLM后训练太烧钱?清华&腾讯有了破解法门:关键是得会Rollout
大模型强化学习后训练中,rollout预算易成瓶颈,且并非所有rollout都有用。清华和腾讯研究者提出TRACE框架,将Agent轨迹视为树,分配预算给易产生“成功/失败对比”的节点,实验显示其效果良好。
0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了
SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。
AI短漫剧的Netflix来了!恒星AI推出全球首个影视级AI Agent「Starfilm」,打造AI短漫剧制作的“超级梦工厂”
恒星AI推出全球首个影视级AI Agent「Starfilm」,能一站式完成AI短漫剧创作。它集剧本、数字人、音乐等核心能力,还搞“星光计划”助力创作者在多平台分发变现,让“一人成剧”梦想成真。
ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力
美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。
我们真的变成巫师了:OpenAI API 负责人谈 AI 如何重塑软件工程
OpenAI API 负责人 Sherwin Wu 在 Lenny's Podcast 上分享,OpenAI 内部 95% 工程师用 Codex,100% PR 由其审查。他谈了 AI 重塑软件工程的现状、未来趋势,提及管理变化、创业效应、部署问题等,也为创业者给出建议。
【栏目对话和访谈】ClawdBot 创始人 Peter:AI 是杠杆,不是替代品;编程语言不重要了,重要的是我的工程思维
这是对 ClawdBot 创始人 Peter Steinberger 的访谈。他分享 ClawdBot 开发历程,认为 AI 是杠杆非替代品,编程语言不重要,工程思维才关键,还预测 80% App 会消失,批判复杂智能体编排系统。
12毫秒暴露自动驾驶致命缺陷,北航新研究实现场景感知的动态物理对抗攻击|TPAMI2025
近日部分L3级自动驾驶车型获批上路,但自动驾驶感知系统存在缺陷。北航等机构提出DynamicPAE框架,实现场景感知的动态物理对抗攻击,解决多维度挑战,在多场景表现优异,被TPAMI2025录用。
AI出码率70%+的背后:高德团队如何实现AI研发效率的量化与优化
文章围绕建立统一数据采集和指标体系,搭建AI统一数据采集能力,定义AI出码率等核心指标,构建AI效率研发指标体系,还介绍了数据采集方案、指标计算等,实现数据驱动闭环。
免训练加速61倍!陈怡然团队新作DPad:仅关注「彩票token」
杜克大学陈怡然团队新作DPad,发现扩散大语言模型关注少量「中奖」token,推理速度可提61 - 97倍,还增强模型语境学习能力。DPad免训练零成本挑关键信息,实现「少算多准」。