「软件评测」共找到 1196 篇相关文章
Code2Video:代码驱动、智能体协同、精准可控的教学视频生成
新加坡国立大学 ShowLab 团队提出 Code2Video,一种基于代码驱动的视频生成新范式。它以可执行代码为媒介,结合三智能体协同框架,解决了现有文生视频方法在教育场景的不足,在美学和教学效果指标上有明显提升。
「从追赶者到引领者,路有多远?」 我们和CANN一线开发者聊了聊
AI浪潮下,硬件竞争转向软件等生态之战,华为昇腾及其CANN站在变革前沿。本文与开发者对话,探讨CANN开源意义、早期挑战、演进及未来战略,开源将带来技术透明、生态赋能等红利。
李建忠:关于AI时代人机交互和智能体生态的研究和思考
在2025全球产品经理大会中,奇点智能研究院院长李建忠分享了大模型驱动的AI产业生态和产品创新。他谈到推理范式转换使模型进入“经验数据时代”,还分析了应用开发、人机交互范式转换及智能体生态演进,预言孤立App时代终结。
基于聊天的 AI 编程高效实践
本文探讨 Agent 对软件开发和开发者工作流的影响,以 GitHub Copilot“Agent 模式”构建维基搜索应用为例,对比不同 LLM 模型性能,指出要发挥 Agent 效能,可采用人机协作流程,经验是掌控其成果的关键。
RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈
大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。
苏妈联手OpenAI,AMD发布3nm怪兽MI355X,性能碾压英伟达B200!
AI芯片战争白热化,AMD在大会发布3nm工艺的MI355X,推理性能超英伟达B200,还公布明年推出的MI400系列等新品。OpenAI CEO称将用AMD芯片,AMD与OpenAI开启合作。
60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了
研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。
摩根士丹利如何攻克编程界的“最头疼问题”
金融巨头摩根士丹利开发AI工具DevGen.AI,将旧代码转现代语言,此难题通用工具难解决。该工具今年审阅900万行旧代码,节省28万小时。虽有局限,但降低对旧语言开发者依赖,且不会减少人才需求。
AI-Native 的 Infra 演化路线:L0 到 L5
文章来自 Agent Infra 创业者 Hang Huang,以其产品开发实践经验,分享 Agent Infra 机会。指出 AI 编程生产力跃迁,从写代码到掌控软件全生命周期是趋势,还提出 L0 - L5 模型描述 AI-Native Infra 演化路径。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。