「基准测试成本」共找到 3371 篇相关文章
用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%
字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。
性能逼近闭源最强,通义实验室开源Mobile-Agent-v3刷新10项GUI基准SOTA
通义实验室开源 Mobile-Agent-v3,覆盖多平台,7B 超同类开源,32B 挑战闭源强手。它有基于云环境的全链路开源方案、全栈 GUI 能力构建和可扩展环境强化学习体系,降低部署开销。
500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式
香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。
1万tokens是检验长文本的新基准,超过后18款大模型集体失智
Chroma团队研究发现,将上下文扩展至1万tokens,18款主流大模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。
20人团队提前实现DeepSeek构想,AI算力变天?直击大模型算力成本痛点
国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对大模型训推痛点,与DeepSeek构想契合,或成大模型专用架构分水岭。
LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了
华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。
Claude 4发布!AI编程新基准、连续编码7小时,混合模型、上下文能力大突破
今天凌晨Anthropic开发者大会发布Claude 4,含Claude Opus 4和Claude Sonnet 4。前者是顶尖编码模型,后者是Sonnet 3.7重大升级。还发布系列产品,定价不变,已上线Amazon Bedrock。
马斯克官宣数字AI员工!世界首富也来养龙虾,测试阶段员工把它当真人
马斯克在X上宣布数字擎天柱/巨硬AI项目,它是能在电脑自动操作的数字员工,可模拟公司运作。该项目早有记载,此前印度小哥曾爆料。巨硬项目曾遇阻,现以数字擎天柱形式推出,由xAI与Tesla联合打造。
腾讯把IMA知识库开源了!WeKnora支持Agent调用、MCP协议扩展,企业级RAG零成本落地
腾讯开源WeKnora,这是面向复杂异构文档的LLM框架,走完整RAG流程。它有Agent模式,支持多种知识库类型和格式,有Web UI。适合公司、研究者、开发者等,还给出了上手步骤和部署提醒。
你的AI“体检”了吗?开源AI红队测试平台,一键自查三大风险
AI圈一边是顶尖模型发布,一边是大模型被“越狱”输出有害内容。腾讯朱雀实验室开源A.I.G平台,能模拟真实攻击对AI产品全方位风险扫描,有大模型体检、基础设施漏洞扫描、MCP Server风险检测三大核心能力。