「性能跑分」共找到 2665 篇相关文章
超长推理还能节省计算!Salesforce开源神器两连发:教大模型边想边省,显著提升数学编程准确率
Salesforce AI Research开源Elastic Reasoning和Fractured Sampling。前者将推理流程分两部分,分配token预算,使输出缩短、准确性提高;后者打碎推理链条,从三维度采样,以更少tokens换更高准确率,均提升数学和编程任务准确率。
大模型下半场,阶跃凭什么领跑多模态之战
国内大模型竞争分资源派、技术派、国家队三阵营,多模态成竞争分水岭。阶跃星辰成立两年发22款自研基座模型,16款为多模态。其坚持理解生成一体化路线,在多模态领域有优势,还布局多应用场景。
68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩
《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。
破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨
DeepSeek官方邮件称7月上线V4正式版,高峰时段API各类token价格翻倍,但其他时段仍维持低价。此前它一直以低价著称,此次涨价或与算力紧张、自建数据中心有关,且更新将带来功能优化和性能提升。
DeepSeek推理再提速80%,V4正式版定档7月中旬
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
豆包 2.1 Pro:属于普通人的代码能力
作者分享用AI写代码的经历,指出豆包2.1 Pro强化Coding Agent端到端交付能力,成本低。还展示用它做的多个案例,如歇后语扭蛋机、文件整理工具等,认为其能解决日常问题,降低Coding门槛。
全球首个完全AI编写的训练框架来了,速度反超英伟达:面壁要用 AI 把国产算力软件重写一遍
面壁智能发布全球首个全由AI编写的训练框架ForgeTrain,在华为昇腾系列上验证,速度超英伟达Megatron 10%。其构建分三阶段,目标是为不同需求“现场锻造”软件,还为国产算力软件生态赶超提供新思路。
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。
Karpathy:写了20年代码,现在像作弊
Karpathy曾造词“vibe coding”,一年后弃用。他开源autoresearch项目,让AI Agent自主跑实验,自己不写代码。他还展示家庭监控分析系统也由Agent完成。他提出“agentic engineering”,认为工具虽变,但深度技术专长更重要。
Anthropic:警惕评测排行榜!差别可能只是机器的内存更大,而已
Anthropic发工程博客指出,AI编程评测排行榜上排名前列的模型分差小,而运行环境硬件配置能让分数波动6个百分点。同一模型在不同沙箱策略下分数不同,资源配置影响评测结果,排行榜分数差距或因硬件。