「评估方法」共找到 2128 篇相关文章
用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%
字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。
一文读懂 RAG 与 KAG:原理、工程落地与开源实战(含代码与链接)
文章介绍RAG与KAG,RAG从文档找证据回答,适合开放域、时效更新快场景;KAG将结构化知识融进生成过程,实体关系与事实一致性更稳。还给出实战建议、工作流要点、最小可跑示例、开源组件及项目等。
超越RAG和DAPT!华人团队新研究引热议:即插即用、无需改变原参即可让模型化身领域专家
华人团队提出比DAPT和RAG更方便、成本更低的方法,即“Memory Decoder”预训练记忆模块。它像“领域知识插件”,即插即用、不改原参,能让Qwen、Llama等模型成领域专家,还降低困惑度。
构建可靠AI Agent:从提示词、工作流到知识库的实战指南
本文阐述如何构建可靠、高效且可落地的AI Agent应用。随着LLM和工具调用标准化,开发核心竞争力转向提示词工程、工作流设计和知识库构建。还介绍各部分要点及安全策略,给出确定AI项目的方法。
图灵奖得主Sutton再突破:强化学习在控制问题上媲美深度强化学习?
图灵奖得主Richard S. Sutton认为未来AI发展需靠强化学习。他将2024年的SwiftTD算法拓展到控制领域,提出Swift - Sarsa算法,还设计操作性条件反射基准测试。实验显示,结合预处理方法,其性能或媲美深度强化学习。
The Batch: 852 | 加州重新制定人工智能监管框架
加州人工智能前沿模型联合政策工作组发布《加州前沿人工智能政策报告》,为立法者提供监管尖端AI模型的政策原则。报告聚焦前沿模型监管,提出综合多源证据、鼓励信息披露等结论,还探讨了美国AI监管现状。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
The Batch: 844 | AI 天气预测加速推进
美国国家飓风中心与 Google 的 Weather Lab 合作,利用新模型预测风暴。该模型能比传统方法更准确预测风暴形成、路径和强度,最长提前 15 天,测试表现优于 Google 之前的 GenCast 模型和 ENS 模型。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
AI驱动的研究报告生成器Open Deep Research
Open Deep Research是AI驱动的研究报告生成器,用户提问题可获全面且有来源的答案。它采用Next.js 15等技术栈,经多步骤生成综合报告,还介绍了克隆与运行方法及项目地址。