「基准测试」共找到 2049 篇相关文章
CVPR 2026 Highlight|让家电「在仿真中运转起来」,北大正式发布RealAppliance!
北京大学团队提出 RealAppliance 数据集与 RealAppliance - Bench 评测基准。前者收录 100 个精细家电资产,与真实产品系统多层面对齐;后者围绕五项任务评估模型家电操作规划能力,实验显示主流模型仍面临挑战。
揭秘与评测 30K+ Star 的 Graphify:企业存量系统 AI 编码的"第二大脑"。
文章揭秘评测 30K+ Star 的 Graphify,它能将分散材料转为结构化知识图谱,助 AI 编程助手理解代码。介绍其使用方法、原理,经测试它能提升综合质量、降低探索成本,不过并非万能解药。
天塌了,Pro用户用不了Claude Code,除非100美元买Max
Anthropic 悄悄修改价格页面,将 Claude Code 从 20 美元 Pro 套餐剔除,变为 100 美元 Max 套餐专属。开发者反应激烈,官方称是针对 2% 新用户的定价测试,OpenAI 借机拉踩,网友质疑,开发者开始物色下家。
Claude强到不敢发的Mythos,被质疑用了字节Seed技术
Claude最强“神话”模型Mythos引发猜测,或用了字节Seed技术。社区热议其是否采用循环语言模型架构,关键线索来自Anthropic测试数据,在图搜索测试中Mythos优势明显,还有其他线索指向循环架构。
HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴
蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。
Flash-Searcher:Web Agent的并行革命
当下Web智能体用顺序执行链解决复杂任务存在执行和信息利用率低的问题。为此提出Flash - Searcher,以DAG并行执行机制为核心,提升执行吞吐与速度,在多基准上表现优,代码已开源。
Thinking Machines 发布 Tinker API,实现灵活的模型微调
Thinking Machines公司发布Tinker API用于开放权重语言模型微调,可减少开发者基础设施开销。支持多种模型架构,集成LoRA,还发布开源存储库。虽有竞品,但Tinker侧重暴露低级原语,尚处封闭测试。
一举击败Claude Code!微软提出代码生成黑科技:一键直出36K行代码
现有方法依赖自然语言规划生成仓库易失效,微软提出Repository Planning Graph (RPG),以图谱替代文字规划。基于此的ZeroRepo框架能让仓库生成可控、可扩、可验证,在新基准RepoCraft上表现远超Claude Code。
ICML 2025 Spotlight | 快手、南开联合提出模块化双工注意力机制,显著提升多模态大模型情感理解能力!
情智兼备是人工智能发展方向,但多模态情感数据语义复杂,建模跨模态关联是挑战。快手可灵团队与南开提出模块化双工注意力范式,构建‘摩达’模型,在多任务测试中性能提升,成果被 ICML 2025 收录。
Fable第一,谁第二?Anthropic钦点8款模型名单曝光
Anthropic官宣Claude Fable 5全球上线,公布安全测试结果,8款模型包括中国的Kimi K2.7。北美公司也用行动认可中国模型,Kimi在多方面表现出色,其商业模式类似Anthropic,未来潜力大。