「基准测试成本」共找到 3416 篇相关文章
这款 Rust 文件搜索项目,让 AI 和 neovim 飞起来!
开发时项目大文件多,找文件成本高。Github上的`fff.nvim`项目专注‘极致速度 + 智能体验’,采用Lua + Rust架构,性能好、排序智能。有多项功能特性,还能与AI助手集成,提升效率。
The Batch: 939 |在推理阶段学习长上下文
大型语言模型处理长上下文时通常准确性降低、速度变慢,研究人员提出TTT - E2E方法,通过推理时训练模型将上下文压缩到transformer权重中,还展示了其运作方式、测试结果等。
让思考更准更长!强化学习新算法FIPO来了
阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
智谱 AutoClaw 深度测评:一键把电脑变成 AI Agent,是神器还是半成品?
本文深度测评智谱最新推出的桌面应用AutoClaw。它宣传能让电脑成AI Agent,引发两极评价。文章从安装、界面、功能、成本等方面测评,指出其优缺点,认为虽不完美但方向值得肯定。
分享2篇OpenClaw最新Skill论文~
OpenClaw作为最大开源Agent框架,其Skill生态安全受关注。分享两篇论文,《Clawdrain》揭示Token耗尽攻击,《SkillFortify》提出形式化防御框架,从攻防维度揭示OpenClaw深层安全风险。
ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态
滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
Anthropic 新研究:AI出错是“热混乱”
Anthropic研究团队发现AI可能无一致目标,只是瞎搞。他们将AI错误分类,测试发现推理越久越混乱,大模型复杂任务易失控。此发现改变对AI风险的认知,论文已在arXiv发布。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。