推理质量评估」共找到 3139 篇相关文章

开源动态8

首个基于MCP 的 RAG 框架:UltraRAG 2.0用几十行代码实现高性能RAG, 拒绝冗长工程实现

检索增强生成系统(RAG)复杂度提升,工程实现成本高。清华大学等联合推出首个基于MCP架构的UltraRAG 2.0,组件化封装、调用扩展灵活,低代码实现高性能,可用于科研和行业应用。

AI前线
产品应用8

谷歌认领最强AI版Photoshop!现在人人可用,效果确实强悍

谷歌认领神秘图像编辑模型nano - banana,即Gemini 2.5 Flash Image。它可免费在Gemini和Google AI Studio使用,API收费。该模型图像编辑能力出色,能合并图片、实现2D到3D转换等,此前爆火却无官方文档。

量子位
新闻资讯7

热议!DeepSeek V3.1惊现神秘「极」字Bug,模型故障了?

DeepSeek 最新的 V3.1 模型上线不到一周,因离奇 Bug 引发社区热议。无论执行何种任务,模型总会在文本中插入「极」字,自我修复时也无法避免,还存在多语言混用问题,网友猜测原因多为「数据污染」。

机器之心
算法论文8

冗长响应缩减80%,DeepSeek GRPO获得颠覆性改进,微软GFPO问世

微软研究员曝出颠覆性强化学习算法 GFPO,能削减推理多余 token 长度达 80%。它基于 DeepSeek 的 GRPO,可同时优化多响应属性,团队还提出自适应难度变体,实验显示 GFPO 在多方面表现出色。

机器之心
8

模型与「壳」的价值同时被低估?真格基金戴雨森 2025 AI 中场万字复盘

这是真格基金管理合伙人戴雨森2025年中对AI行业的半年度复盘。他从投资人视角,围绕OpenAI通用大模型达IMO金牌水准、ChatGPT Agent发布等热点,分享AI应用、模型、产品“壳”价值等看法,认为模型和应用价值被低估。

Founder Park
新闻资讯7

OpenAI被曝IMO金牌「造假」,陶哲轩怒揭内幕!

OpenAI高调宣称摘下IMO数学金牌,却被组委会内部人士爆料未与官方合作、无视规则提前官宣。菲尔兹奖得主陶哲轩暗指其成绩存疑,网友也不满其炒作。UCLA教授认为大模型短期难取代数学家。

新智元
算法论文8

一篇95页最新80种Deep Research系统全面综述

浙大研究深度研究系统领域,分析自2023年以来80多个实现,提出4维度分层分类法,全面剖析4种实现架构,如单体、流水线、多智能体和混合架构,并阐述各维度演变与进步。

CourseAI
开源动态7

阿里达摩院开源多模态医学大模型—灵枢

大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。

AIGC开放社区
新闻资讯7

Meta为他豪掷2亿美元,上交校友庞若鸣,晒出在苹果的最新论文

苹果基础模型团队负责人庞若鸣即将加入Meta,Meta为其开出2亿美金天价。7月9日庞若鸣宣传在苹果参与的研究《AXLearn: Modular Large Model Training on Heterogeneous Infrastructure》,介绍了AXLearn系统优势、架构、实验评估等。

机器之心
开源动态7

野生DeepSeek火了,速度碾压官方版,权重开源

近日,德国AI咨询公司TNG推出的「DeepSeek R1T2」模型火了,速度比R1快20%,性能不弱于R1。它采用AoE技术,融合官方三大模型,开源且在Hugging Face开放权重,获不少人期待。

机器之心