学术搜索评测」共找到 1168 篇相关文章

开源动态8

只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。

近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。

数字生命卡兹克
算法论文8

告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代

大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。

深度学习自然语言处理
新闻资讯7

NeurIPS近3万投稿爆仓,强拒400篇论文!博士疯狂内卷,AI顶会噩梦来袭

AI顶会现「爆仓危机」,NeurIPS 2025双会场仍难容纳近3万投稿,约400篇已录用论文被拒收。AAAI 2026投稿也破纪录,近7成来自中国。各顶会录用率降、审稿人缺、质量下滑。

新智元
新闻资讯7

OpenAI女CEO太狠了!智商148,GPT-5才是真印钞机

GPT-5智商高达148,在多基准测试表现亮眼获英伟达认可。OpenAI借“路由器”为ChatGPT商业化铺路,它能分流降成本、让免费用户接触深度思考模型,还可变身广告分配器,实现AI广告变现。

新智元
开源动态8

通义实验室大火的 WebAgent 续作:全开源模型方案超过GPT4.1 , 收获开源SOTA

WebAgent续作《WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization》提出对information-seeking任务形式化建模,设计训练数据合成方法,全开源模型方案在GAIA评测获SOTA表现,还补足了训练数据不足问题。

机器之心
新闻资讯7

为什么Cloudflare无法阻止Google为AI 模型爬取网站数据?

Cloudflare推出阻止AI爬虫抓数据功能,却对Google无效。因Googlebot身兼两职,Cloudflare难区分其请求目的。出版商流量因Google AI功能下降,网站主在被剥削和失去流量间两难。

AGI Hunt
算法论文8

给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案

现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。

机器之心
产品应用8

kimi 的RL end2end ON LLM

文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。

Agent的潜意识
算法论文8

一文读懂深度表格数据表示学习 | 南京大学

南京大学团队系统介绍表格表示学习领域,将现有方法按泛化能力分三类,比较DNN与树模型优劣,剖析核心挑战,探讨扩展方向及数据集评估策略,旨在建跨数据集稳健评估体系。

量子位
推荐文章7

R1时代,RAG-Retrieval技术总结与展望~

RAG - Retrieval提供全链路RAG检索模型微调、推理及蒸馏代码,支持多模型、多loss和训练方式。还发布模型技术报告,设计评估框架,未来探索RL在检索领域应用。

PaperAgent