学生评估」共找到 814 篇相关文章

开源动态7

无需 OCR 就能从各类文档中提取结构化信息的本地化开源工具docext

docext是无需OCR的本地化开源工具,能从发票、护照等文档图像提取结构化信息。智能文档处理排行榜评估VLMs在多任务表现,docext有灵活提取、表格提取等功能。

GitHubStore
算法论文8

北大DeepSeek论文或预定ACL Best Paper!梁文锋署名

北大DeepSeek联合发布的NSA论文已被ACL 2025录用且评分高,有望冲击最佳论文。该技术革新传统注意力机制,提升算力效率,是长文本处理的突破。此外,张铭教授团队还有多篇论文上榜。

新智元
产品应用7

OpenAI很看好!首个SWE-1模型发布,软件开发或将提速99%

Windsurf发布首个前沿模型SWE-1,目标将软件开发提速99%。它不只能写代码,还能协助软件工程流程。有三个系列模型,SWE-1运行成本低,SWE-1-lite对所有用户开放,SWE-1-mini适用于低延迟场景。

新智元
算法论文8

一篇论文改写AI科研评价规则!中国公司拿出实践数据,双榜第一、成本更低

今年科技巨头入局AI4S,想打造“AI科学家”。8月19日《Measuring AI Scientists: From Exams to Discovery》论文提出评价范式。深度原理MIRA平台是现实样本,在评测中表现优异,沉淀闭环数据。

量子位
开源动态8

在校生开发,榨干 win 系统全部带宽!

介绍在校生开发的开源工具 HypoMux,它面向 Windows,能把多张网卡「绑」在一起,让下载任务多线路并行。有双模式可选,还能智能分流,兼容主流加速器。操作简便,可解决下载慢问题。

开源先锋
算法论文8

ICML 2026 | 大模型内部也会长出「情绪树」,规模越大越懂人心

ICML2026 论文指出,大语言模型内部会自然形成类似人类心理学模型的「情绪树」,模型越大,情绪树越复杂,且在销售等任务上表现更好。同时,模型的情绪结构受身份设定影响,存在与人类相似的情绪识别偏见。

机器之心
算法论文8

0%完成率!Claude、GPT、Gemini 全灭,SWE-Bench作者新作把AI圈干沉默了

SWE - Bench创建者推出新benchmark ProgramBench,测试AI从零构建软件系统能力。结果一线模型完成率0%,暴露AI擅长局部代码生成,缺全局系统规划能力,引发对其评估方式的讨论。

机器之心
算法论文8

π0.7来了!涌现出组合泛化、跨本体迁移能力,VLA又行了?

具身赛道玩家 Physical Intelligence 发布新模型 π 0.7,它展现出组合泛化和跨本体迁移能力,还能通过知识蒸馏学会优化技巧。其强大源于杂数据和细提示,未来有望解决复杂任务。

机器之心
产品应用7

规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注

为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。

InfoQ
算法论文8

2026 AI Memory最新综述:从理论到实战,一文读懂AI记忆的进化全景

2026年北邮百家AI MemoryOS团队联合华为发表《Survey on AI Memory》,涵盖AI记忆理论基础、分类体系、架构、评估方法与前沿趋势,还提出4W分类法,剖析了发展挑战与未来方向。

PaperAgent