「基准测试成本」共找到 3387 篇相关文章
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
二十年老牌 IDE 栽在 AI 上?JetBrains 被差评逼疯批量删除评论,用户怒打 1 星抗议
JetBrains的AI助手插件下载超2200万次,但评分仅2.3分。用户不满其自动安装、速度慢、bug多等问题,负面评论被批量删除引发抗议。公司虽推出免费套餐和新AI智能体Junie,但仍面临成本、竞争等难题。
华为统治折叠屏
今年折叠屏市场平淡,小折叠被放弃、大折叠更新佛系,因成本高、出货难。但华为逆势上扬,2025年推出四款机型,2026年上半年Pura X Max销量超50万台。折叠屏难打性价比,华为靠创新和品牌优势统治市场。
一个月的活一周干完!英伟达世界模型训练速度飙升400%
英伟达世界动作模型 DreamZero 训练成本高、耗时长,无问芯穹与清华等推出的 RLinf 框架,从算子融合到 I/O 全链路系统级重构,使训练吞吐拉高近 4 倍,还解决多类性能瓶颈,保证训练效果。
不吹不黑,在Agent任务上,kimi 2.6确实让我忘了Claude。
Kimi K2.6发布并开源,代码和Agent能力提升。作者测试发现,它在部署Claude Code源码、网站生成、多智能体任务等方面表现出色,审美提升,思维活跃,还能复刻文档风格,开源释放了前沿编程能力。
1美元时薪?这才是打工人的「梦中情模」
Anthropic 的 Opus 4.6 好用但贵,MiniMax 推出 M2.5 与之抗衡。M2.5 在多方面表现卓越,参数量小,成本低,推理速度快,还经实测能成打工人得力助手,其背后有独特训练体系。
长生不老成真?哈佛AI数周破解「衰老密码」,人类寿命或迎重写
哈佛团队借助AI系统K-Dense揭示衰老分阶段运行的秘密。K-Dense采用层级多代理架构,能完整跑通研究流程,在BixBench测试中超越GPT - 5。它还让哈佛团队几周完成原本数年的研究,成果待同行评审。
Rex-Omni:用 3B 模型颠覆目标检测
长期目标检测依赖传统坐标回归模型,MLLMs方法存在不足。IDEA研究院提出30亿参数的Rex - Omni多模态大模型,在零样本测试中表现超现有回归模型,还具备丰富语言理解能力,有独特设计和训练流程。
POF | 西交大陈泽伟、陈刚等:面向可变形域非周期非定常流动的几何自适应时空深度学习框架
西交大陈泽伟、陈刚等人提出ViT - STFlowNet框架,用于可变形域非周期非定常流动预测。该框架融合自适应网格变换与ViT架构,克服传统方法局限,测试显示预测精度高、泛化能力好,为飞行器流场感知控制提供工具。
GPT-5几个预测:用户翻倍,编程登顶,屠杀一众模型
OpenAI发布GPT-5,登顶大模型测评榜单。它有统一智能架构,在多测试取得突破,编程能力强击败对手。还改进意图,减少幻觉、增加情感、在健康领域更实用,价格便宜。作者预测其将带来用户翻倍等影响。