「评估框架」共找到 2212 篇相关文章
谷歌发76页智能体白皮书!你的「AI替身」已上线
谷歌发布76页AI智能体白皮书,剖析其应用前景。涵盖智能体运维、评估方法,探讨多智能体架构,还介绍智能体增强检索生成及企业应用,如NotebookLM企业版、Agentspace空间企业版等。
让沉默三千年的甲骨开口:首个模仿人类专家工作流的辅助释读系统
近日,华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,辅助甲骨文破译。它整合多类资料,形成证据链,经专家评估,有较高评价且能节省分析时间。
The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出
OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。
ICLR 2026 Oral | 没人诱导,大模型也会「骗人」
新加坡国立大学 Bingsheng He 教授团队论文关注无诱导下大模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。
ICLR 2026 | 别再让大模型“想太多”了!最新研究揭示 LLM 推理效率的关键瓶颈
大语言模型推理计算成本失控,存在过度与思考不足问题。研究揭示推理失衡是根源,提出BAM模型及Plan - and - Budget框架,实验显示其能提升准确率与效率,转向‘推理价值’范式。
别再让语音机器人“答非所问”:AI Force任务型语音对话技术总结
本文围绕企业级任务型语音Agent核心挑战,提出解决“拟人化”与“专业化”问题。介绍三段式语音对话解法、架构演进,还提及‘衍算’推理框架等技术及未来方向,团队来自蚂蚁集团AI force。
推出 AnyLanguageModel:在 Apple 平台统一本地与远程大语言模型的 API
大语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。
MiniMax 上市后的第一个开源:给 Coding Agent 立个规矩
2026 年初 MiniMax 成功上市港股,市值达 1100 亿港币。其上市后首个开源项目 OctoCodingBench 聚焦 Coding Agent 评估,解决规则复杂时 Agent 合规问题,为其立规矩,有重要社区价值。
AI 的本质不是算力,而是「上下文革命」
上交大刘鹏飞团队提出人工智能本质是“上下文革命”,在论文中把“上下文”提升为智能系统核心结构,提出“上下文工程”学科框架,通过实验揭示智能发展规律,为AI发展指明新方向。
字节Lynx:从单张图像生成高保真个性化视频
字节推出高保真个性化视频生成框架Lynx,基于开源的Diffusion Transformer,引入ID - adapter和Ref - adapter,在基准数据集表现优异,能平衡身份保真度等,还可拓展至多模态和多主体。