评估范式」共找到 1651 篇相关文章

算法论文7

Meta最新大模型RL微调:在线DPO/GRPO显著优于离线DPO

Meta和NYU研究强化学习在大模型微调中的有效性,对比离线、半在线和在线训练范式。半在线和在线显著优于离线,多任务结合可验证与不可验证任务能提升性能,还给出不同任务的测试数据。

PaperAgent
开源动态8

生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架

港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。

量子位
新闻资讯8

陶哲轩再爆:一个月三破18年未解难题!AlphaEvolve彻底改写数学研究规则

一项封尘18年的数学难题,在短短30天内被AlphaEvolve与人类联手三度突破,和差集指数θ从1.173050提升至1.173077,刷新加法组合学天花板,展示了AI与人类协作的新范式

新智元
开源动态8

全球首个AI智能体「自进化」开源框架来了!一次部署,终生可用

英国格拉斯哥大学团队发布全球首个AI智能体自进化开源框架EvoAgentX,打破传统多智能体系统构建与优化限制。它有自动化构建、自进化机制和系统性评估亮点,实验验证其性能提升显著。

新智元
算法论文7

AI生成的图片正在反向对齐人类的审美?ICML 2026观点论文Spotlight

UBC和Weathon Software研究指出,图像美学对齐削弱艺术表达。开发者用评估模型让图像生成模型产出符合人类审美的图片,但这导致图片同质化,限制艺术多元性,作者还提出六个相关担忧,并做多项测试验证。

机器之心
算法论文8

当SFT遇上RL:基于样本学习阶段的动态策略优化机制

在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。

量子位
算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。

机器之心
产品应用7

Lyft 使用 AI 和人机协同扩展了全球范围内的本地化能力

Lyft 实现 AI 驱动的本地化系统,加速应用与网页内容翻译。新系统结合大语言模型、自动评估与人工审核,将翻译周期从数天缩至分钟级,兼顾质量与适配性,还分批量和实时翻译架构处理不同场景。

InfoQ
开源动态8

探针伸进大模型黑箱,南加州大学华人团队打造AI记忆研究的深空望远镜

南加州大学 Robin Jia 教授团队借助英伟达算力,构建基于 Llama 3 架构的全开源受控大模型 Hubble,其成果将在 ICLR 2026 亮相。研究揭示大模型记忆机制效应,还评估了‘机器遗忘’技术,有法律应用潜力。

DeepTech深科技
推荐文章8

AI搜索优化(GEO):从“被看见”到“被选中”的7个真相!【必看】

白杨SEO分享AI搜索优化(GEO)从“被看见”到“被选中”的7个真相,含为何做GEO、竞争内容、让AI理解和信任品牌的方法、成默认推荐答案的条件、效果评估及长期坚持的原因等。

白杨SEO优化教程