基准测试成本」共找到 3371 篇相关文章

开源动态8

用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%

字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。

量子位
开源动态8

性能逼近闭源最强,通义实验室开源Mobile-Agent-v3刷新10项GUI基准SOTA

通义实验室开源 Mobile-Agent-v3,覆盖多平台,7B 超同类开源,32B 挑战闭源强手。它有基于云环境的全链路开源方案、全栈 GUI 能力构建和可扩展环境强化学习体系,降低部署开销。

机器之心
开源动态8

500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式

香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。

量子位
算法论文7

1万tokens是检验长文本的新基准,超过后18款大模型集体失智

Chroma团队研究发现,将上下文扩展至1万tokens,18款主流大模型集体“失智”,“智商”非均匀下降,在一些节点会断崖式下跌。研究还设计四项对照实验,证明LLMs性能随输入长度增加显著且非均匀下降。

量子位
开源动态7

20人团队提前实现DeepSeek构想,AI算力变天?直击大模型算力成本痛点

国内20人玉盘AI团队推出SRDA全新计算架构方案,试图从硬件源头解决当前AI算力核心瓶颈。该架构有诸多创新设计,能应对大模型训推痛点,与DeepSeek构想契合,或成大模型专用架构分水岭。

新智元
算法论文7

LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了

华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。

机器之心
产品应用8

Claude 4发布!AI编程新基准、连续编码7小时,混合模型、上下文能力大突破

今天凌晨Anthropic开发者大会发布Claude 4,含Claude Opus 4和Claude Sonnet 4。前者是顶尖编码模型,后者是Sonnet 3.7重大升级。还发布系列产品,定价不变,已上线Amazon Bedrock。

Founder Park
新闻资讯7

马斯克官宣数字AI员工!世界首富也来养龙虾,测试阶段员工把它当真人

马斯克在X上宣布数字擎天柱/巨硬AI项目,它是能在电脑自动操作的数字员工,可模拟公司运作。该项目早有记载,此前印度小哥曾爆料。巨硬项目曾遇阻,现以数字擎天柱形式推出,由xAI与Tesla联合打造。

量子位
开源动态8

腾讯把IMA知识库开源了!WeKnora支持Agent调用、MCP协议扩展,企业级RAG零成本落地

腾讯开源WeKnora,这是面向复杂异构文档的LLM框架,走完整RAG流程。它有Agent模式,支持多种知识库类型和格式,有Web UI。适合公司、研究者、开发者等,还给出了上手步骤和部署提醒。

小华同学ai
开源动态8

你的AI“体检”了吗?开源AI红队测试平台,一键自查三大风险

AI圈一边是顶尖模型发布,一边是大模型被“越狱”输出有害内容。腾讯朱雀实验室开源A.I.G平台,能模拟真实攻击对AI产品全方位风险扫描,有大模型体检、基础设施漏洞扫描、MCP Server风险检测三大核心能力。

腾讯技术工程