推理质量评估」共找到 3139 篇相关文章

算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
产品应用8

谷歌Nano Banana Pro上线,深度结合Gemini 3,这下生成世界了

谷歌最新图像生成模型Nano Banana Pro(Gemini 3 Pro Image)上线,结合Gemini 3 Pro强大推理与知识,在控制力、文字渲染和世界知识方面升级,能生成高分辨率、一致性强图像,还支持创意操控、多语言文本生成等,多产品将上线。

机器之心
产品应用7

央企怎么做超级智能体?对谈中电信天翼AI:自研模型为底座,自主规划是必须,能适应千行百业才行

中国电信天翼AI发布星辰超级智能体,获2025企业级AI Agent榜单央企第一。它依托自研“星辰大模型”,具备全模态、复杂推理等能力。访谈专家指出智能体可直接产出应用,落地需嵌入主业系统,电信持续迭代模型优化它。

量子位
新闻资讯7

星海图高继扬:具身智能下半场,应用为王

星海图CEO高继扬在AGI Playground大会分享具身智能观点,认为2026年是下半场,核心是应用。具身智能发展慢因缺高质量数据和合适本体,未来产品形态或为‘整机+预训练模型+后训练工具’,下游将形成大生态。

Founder Park
新闻资讯7

五源刘凯:喧嚣只是表象,AI创业才刚刚开始|5Y View

五源合伙人刘凯在圆桌会上谈AI创业现状。他认为AI正从集中走向开放,创业者主动权增大。还提及投资AI项目的判断标准,指出ARR在C端产品失去参考价值,不同类型项目评估方式有别,且认为当下AI创业才起步。

五源资本 5Y Capital
8

RAG技巧与底层代码剖析

文章深入剖析 RAG 技巧与底层代码,从用 Python 基础库构建 RAG 系统,到多种优化方法如上下文增强检索、添加上下文块标题等,还涉及查询改写、重排序等技术,最后介绍了上下文压缩、反馈机制等提升系统效率和质量的方法。

阿里云开发者
产品应用7

这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测

作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。

AI产品黄叔
新闻资讯8

突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA

OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」实测成绩亮眼,AI推理性能超英伟达全系,功耗仅为一半。它从设计到流片仅用九个月,得益于GPT - Astra协助。有观点认为CUDA护城河或已死,OpenAI正打造算力版图。

新智元
新闻资讯7

6 天、96 万行 Rust、直接合并?Claude Code 被 Bun 的内存泄漏拖垮后,Bun 让 Claude 亲手重写了自己

2026 年 5 月,Bun 创始人 Jarred Sumner 宣布将合并 Rust 重写版本,终结 Zig 版。此次迁移仅用六天,涉及 96 万行代码。此前,Bun 内存泄漏影响 Claude Code,促使 Anthropic 让 Claude 重写 Bun。不过,AI 重写也引发对代码质量和流程的争议。

InfoQ
产品应用8

SDD-RIPER 团队落地指南:如何让整个团队在一周内跑通大模型编程

文章提供了 SDD - RIPER 团队落地方案,能让团队一周内跑通大模型编程,质量可控、效果可量化。阐述了推不动大模型编程的痛点及 SDD - RIPER 的解决办法,介绍了部署、实操流程和试点 SOP,还给出效果数据与常见问题解答。

阿里云开发者