「性能对比」共找到 2319 篇相关文章
AI在「赚钱锦标赛」夺冠,比人类还会做生意!躺赚时代要来了?
研究人员提出自动售货机运营模拟环境Vending - Bench,测试大模型智能体管理业务能力。实验显示不同大模型性能方差大,Claude 3.5 Sonnet净资产表现最佳,人类基线在可靠性上表现较好,各模型长周期表现波动大。
68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩
《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。
从马斯克并购 Cursor 说起:国内编程智能体的牌桌、裂缝与全链自主之路
文章从马斯克600亿美元收购Cursor切入,分析海外编程智能体“垂直整合”趋势,指出护城河在全链掌控。对比国内,玩家分散,面临版权、安全等风险。强调中国须走全链自主之路,各层发力,目标是经略全球。
破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨
DeepSeek官方邮件称7月上线V4正式版,高峰时段API各类token价格翻倍,但其他时段仍维持低价。此前它一直以低价著称,此次涨价或与算力紧张、自建数据中心有关,且更新将带来功能优化和性能提升。
ICLR发了Oral又反悔,理由是查到了制裁名单?
一篇被ICLR接受为Oral的论文,因作者在arXiv预印本提及工作部分在被美国制裁的RAIRI机构完成,遭ICLR无视审稿直接拒稿。网友将其与NeurIPS类似事件对比,还对作者是否“刻意隐瞒”有不同看法。
谷歌AI的“心脏”长什么样?读懂TPU就够了
文章介绍了谷歌TPU的发展历程,从2015年为解决AI计算效率瓶颈自研,发展到如今成为谷歌“经济支柱”。还对比了谷歌、英伟达、亚马逊的芯片路线,强调谷歌全栈垂直整合策略使TPU在推理时代优势明显。
阿里开源Qwen3-Coder-Next,80B参数仅激活3B的MoE顶尖编程助手
阿里开源小型MoE代码模型Qwen3 - Coder - Next,总参数量800亿但仅激活30亿参数,在代码生成等任务表现出色。团队构建训练技术栈解决数据匮乏,模型训练分阶段,多领域专家模型能力整合,基准测试性能强劲。
核心AI场景首超英伟达,一场国产算力的“破局叙事”|甲子光年
1月26日,天数智芯公布四代架构路线图,其2025年的天数天枢架构,在DeepSeek V3场景实测性能领先英伟达Hopper约20%。该企业以技术创新、解决行业痛点等构建新范式,产品全场景布局且已规模化落地。
Agent 真正的护城河,正在从工具转向记忆资产
2026年初,Anthropic用Claude Cowork引发AI创业热点,其计划引入知识库获“永久记忆”能力,将Agent Memory探索推到前沿。文章探讨独立Memory层成必需品的原因、工程化记忆系统的能力,还对比模型厂商和第三方中立派路线。