传统软件测试」共找到 3187 篇相关文章

算法论文8

LeCun新作反杀AGI派!AI连「鸟」都搞不懂,拿什么超越人类?

图灵奖得主Yann LeCun联手斯坦福团队最新论文揭示,LLM仅在粗糙分类任务表现优秀,精细任务却失灵。研究测试30多个大模型,得出三大发现,指出LLM与人类在概念形成和信息处理上存在本质差异。

新智元
产品应用8

大模型推理的“左右脑”革命!华为盘古Embedded凭昇腾之力,让快慢思考合二为一

传统大模型推理面临长链条深度思考与低时延反馈的矛盾,华为盘古团队提出盘古Embedded模型。基于昇腾NPU,其采用双系统认知架构,集成“快思考”与“慢思考”双推理模式,实现推理效率与精度协同提升。

机器之心
产品应用7

一家智能眼镜公司,为什么非要自研AI大模型系统?|甲子光年

智能眼镜要么不够智能,要么不像眼镜,李未可科技CEO茹忆认为AI要成第一响应者。该公司推三款AI眼镜,搭载自研系统。其自研AI大模型系统,是为交付难复制AI体验闭环,解决通用API不足等问题。

甲子光年
推荐文章7

小米玄戒O1,五个争议问题与解释

文章围绕小米玄戒O1提出五个争议问题并解释。涉及是否为国产、自研芯片,手机SoC研发难点、小米做SoC原因及玄戒O1是否成功,还结合苹果、高通等案例阐述芯片产业分工等知识。

芯师爷
开源动态8

微软开源浏览器Agent,可实时跟踪、控制智能体,超4000颗星

微软在官网开源用于浏览器网络任务的Agent——Magentic - UI,基于Magentic - One开发,支持人机协同。GAIA测试显示其能提升任务完成率和准确率。它以人为本,有独特机制,框架含多阶段,在Github超4000颗星,支持MIT许可证商用。

AIGC开放社区
算法论文8

与Gemini Diffusion共振!首个扩散式「发散思维链」来了

西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型。

机器之心
开源动态8

红杉中国xbench全球首发,AI智能体真实战力揭榜!

红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。

新智元
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【八】| 什么是残差连接?

本系列是对长篇文章《Understanding LLMs from Scratch Using Middle School Math》的解读笔记。本篇介绍残差连接,指出传统多层模型有网络退化和梯度传导困难问题,而残差连接能缓解,还说明了其工作原理和可行性。

AI大模型应用实践
推荐文章7

“由 AI 生成的代码,从诞生那一刻起就是「遗留代码」!”

如今生成式AI融入软件开发,AI生成的代码一诞生或被视为“遗留代码”。它缺乏上下文记忆和维护连续性,虽有开发者尝试弥补,但代码未来或多靠提示生成。文章观点在Hacker News引发讨论。

AI科技大本营
算法论文7

无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%

当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。

深度学习自然语言处理