「学科考试基准」共找到 952 篇相关文章
上下文工程(Context Engineering)综述:大模型的下一个前沿
文章提出“上下文工程”学科,通过整合1400余篇论文构建“基础组件 - 系统实现”框架。它将上下文定义为动态结构化信息集合,揭示LLMs理解强于生成的矛盾,为AI研究指明方向。
这个开源PDF解析器,拿了全球第一
OpenDataLoader在主流PDF解析器基准测试中排第一,尤其是表格提取准确率高。它功能丰富,有本地和混合两种模式,还将推出免费自动标记功能,支持与LangChain集成。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
AI 如何讲好一个多人故事?首个支持多角色互动的3D场景叙事系统
首尔国立大学提出全新框架,能生成虚拟动态场景并支持多角色上下文动作生成。引入LLM拆解复杂任务,系统用事件驱动方式规划动作,还构建基准评估相关能力,有良好扩展性和实用性。
1200行代码逆袭!DeepSeek工程师开源轻量级vLLM,吞吐量逼近原版
开源 vLLM 可提升 LLM 推理速度和资源利用率。近日,DeepSeek 工程师俞星凯开源轻量级 Nano - vLLM,代码仅 1200 行,基准测试中吞吐量逼近原版,项目已在 GitHub 获 200 多 Star。
GPT-5都救不了的AI幻觉,原来问题不在模型,在“考卷”
OpenAI研究指出AI产生幻觉的根本原因是评估和激励机制有问题。现有训练和评估流程奖励‘猜测’,导致模型易产生幻觉。研究还给出解决方案,要更新‘考试规则’,让模型适当表达不确定。
首个英文原生「弱智吧」!逻辑谬误数据集与生成框架来了 | AAAI'26
研究发现大模型判断逻辑谬误易误报正常句子,但分类能力较强。研究人员构建英文逻辑谬误基准SMARTYPAT - BENCH,开发生成框架SMARTYPAT,为大模型逻辑评估提供新思路,可用于多领域。
卷疯了!2.2k Star通用型、开源Agent平替Manus、GenSpark AI
2025 年是 Agent 之年,文中介绍了 Manus、GenSpark AI 两款闭源代理,还重点阐述开源的 II - Agent,它功能丰富,架构设计合理,在 GAIA 基准测试评估,性能可平替前两者。
智元机器人发布并开源首个机器人动作序列驱动的世界模型
近日,智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,打破具身智能演进制约。
Alibaba开源WebDancer解决DeepResearch复杂信息检索难题
Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它在GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。