基准测试成本」共找到 3416 篇相关文章

开源动态8

这款 Rust 文件搜索项目,让 AI 和 neovim 飞起来!

开发时项目大文件多,找文件成本高。Github上的`fff.nvim`项目专注‘极致速度 + 智能体验’,采用Lua + Rust架构,性能好、排序智能。有多项功能特性,还能与AI助手集成,提升效率。

开源先锋
算法论文7

The Batch: 939 |在推理阶段学习长上下文

大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。

DeeplearningAI
算法论文8

让思考更准更长!强化学习新算法FIPO来了

阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。

千问大模型
算法论文8

港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026

扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。

AI科技评论
产品应用7

智谱 AutoClaw 深度测评:一键把电脑变成 AI Agent,是神器还是半成品?

本文深度测评智谱最新推出的桌面应用AutoClaw。它宣传能让电脑成AI Agent,引发两极评价。文章从安装、界面、功能、成本等方面测评,指出其优缺点,认为虽不完美但方向值得肯定。

AI科技评论
算法论文8

分享2篇OpenClaw最新Skill论文~

OpenClaw作为最大开源Agent框架,其Skill生态安全受关注。分享两篇论文,《Clawdrain》揭示Token耗尽攻击,《SkillFortify》提出形式化防御框架,从攻防维度揭示OpenClaw深层安全风险。

PaperAgent
开源动态8

ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态

滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。

机器之心
算法论文8

数据邪修大法好:仅用文本数据就能预训练多模态大模型

多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本

量子位
算法论文7

Anthropic 新研究:AI出错是“热混乱”

Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。

AI工程化
产品应用8

劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束

谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。

InfoQ