「全AI公司」共找到 10940 篇相关文章
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
刚刚,ICML 2025录用结果公布!好评论文惨遭拒,审稿人敷衍引全网怒喷
ICML 2025录用结果公布,共提交12107篇有效投稿,3260篇被接收,录用率26.9%。此次评审质量遭热议,出现审稿人敷衍、评审错误等问题,同时展示了部分网友的论文录用和拒稿情况。
零样本刷新三项基准:ZeroDiff++让AI边考试边学习 | TPAMI'26
本文介绍发表于IEEE TPAMI 2026的ZeroDiff++模型,是ICLR 2025 ZeroDiff的扩展工作,针对生成式零样本学习的虚假语义关联、分布脱节问题提出新框架,在三项主流基准刷新成绩
华为GTS让Agent学会「看着网络排障」,双防火墙难题几乎全拿下
本文介绍华为GTS算法团队针对大模型Agent网络排障遇到的「拓扑失忆」痛点,提出NetCanvas方案,通过可交互视觉拓扑实现认知卸载,大幅提升复杂网络排障的准确率和效率。
“毋在浮沙筑高台”:汪源谈智能体想从 80 分跨到 90 分,全卡在上下文
前网易副总裁汪源在2026奇点智能产品大会分享,指出智能体系统瓶颈正从模型能力、Harness工程,转移到上下文。他还介绍了做好上下文基础设施的要点,以及推出的新内容格式KRL。
不换模型,效果提升104%!上海AI Lab让Harness也能自进化了
上海人工智能实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。
AI写代码终于不瞎烧钱了:边车路由让顶级性能成本直降35%
传统模型路由用于写生产代码易掉链子,Cognition发布的Devin Fusion混合模型框架可解决该问题。官方测试显示,它能降35%编码智能成本且质量无明显下滑,从实际测试案例可看出其适用边界。
AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性
中国科学技术大学等多机构研究者发表综述,梳理超500篇论文,揭示扩散模型视觉内容合成“一致性危机”,介绍三类一致性关系、加强位置、评估问题,指出未来模型需具备冲突感知等能力。
翁荔最新博文深度拆解Scaling Laws:AI行业最信赖的公式,没有那么可靠
6月24日,前OpenAI安全研究副总裁翁荔在博客发表长文,对缩放定律进行系统梳理,指出该理论在实际拟合和外推过程有易被忽视的陷阱,还讨论了数据有限时定律是否成立等问题。