长青评估机制」共找到 1534 篇相关文章

新闻资讯8

刚刚,Anthropic官方Cluade 5使用指南发布

Anthropic发布Claude 5的Context Engineering官方指南,指出为Claude Opus 5和Claude Fable 5删掉Claude Code超80%的system prompt,在编码评估上无明显损失。还揭示6组范式反转及四类上下文载体新分工。

PaperAgent
开源动态8

本地运行、支持视觉与工具调用:Meta 开源智能体模型

Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。

AI前线
产品应用8

Seedance 2.0之后,又一中国视频模型SkyReels-V4登上全球第二

昆仑天工发布SkyReels V4视频大模型,在Artificial Analysis Arena基准测试中排全球第二。它支持多模态输入、音视频同步生成等,采用独特架构与技术,经多阶段训练,有全新评估基准,表现出色。

AIGC开放社区
算法论文8

Agent框架各自为战?谷歌&微软:用Agent-KB让经验自由流动

当前不同框架的Agent知识无法互通,谷歌、耶鲁、字节、oppo等团队联合提出Agent KB,这是通用记忆基础设施,能让异构Agent框架共享经验。它有师生双阶段检索机制,实验验证其能带来显著增益。

PaperAgent
算法论文8

6款小游戏难倒所有顶级VLM!愤怒的小鸟让它们全军覆没,性能不如随机猜测

淘天集团未来生活实验室提出首个系统性评估多模态大模型(VLM)交互式物理推理能力的综合基准DeepPHY。它集成六个物理环境,对17个主流VLM测试,揭示其在物理交互等方面短板。

量子位
新闻资讯7

The Batch:836 | 基准测试成本攀升

独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。

DeeplearningAI
开源动态7

全新开源视频换装框架MagicTryOn

现有视频虚拟试穿(VVT)方法在时空一致性和服装内容保留方面有挑战,浙大提出全新开源视频换装框架MagicTryOn,利用全自注意力机制统一时空建模,设计服装保留策略,还引入掩码感知损失。

带你学AI
新闻资讯7

太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首

大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。

机器之心
开源动态7

Agent能自己“复盘”和“进化”,这个开源框架牛了!

文章介绍了自进化AI,其核心是执行、评估、进化的反馈循环,能自动修改Prompt和工作流。还讲解了SEW、TextGrad等优化器原理,并以SEW为例展示逻辑,最后推荐开源框架EvoAgentX。

探索AGI
新闻资讯7

直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?

为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。

深度学习自然语言处理