「生成器与验证器」共找到 7217 篇相关文章

推荐文章7

大模型评估排障指南 | 关于 LaTeX 公式解析

这是大模型评估排障指南系列第二篇,聚焦 LaTeX 公式解析。评估难点是解析和比较模型输出与标准答案,无标准方法。lm - evaluation 框架用 sympy 解析准确率约 0.94,还给出缓解问题办法。

Hugging Face
算法论文8

Reasoning的最终答案可能不是模型想要的答案!

大型语言模型解决复杂问题有推理过程和答案,传统评估只看最终答案。论文提出最终答案可能不佳,中间步骤更值得研究。还介绍通过切割推理过程发现中间步骤藏玄机,提出‘分步检查法’提升模型表现,实验表明准确率最高提升13%等。

深度学习自然语言处理
开源动态8

这,太狠了:35k Star Lightpanda

本文介绍GitHub上35k Star的开源项目Lightpanda,它是专为Agent自动化打造的轻量无头浏览器,从零开发砍掉冗余桌面外壳,大幅降内存提速度,明确说明了适用场景与使用边界。

小华同学ai
新闻资讯9

突发,Claude刷新物理学世界纪录!单挑基于杨振宁理论9圈难题

本文报道Anthropic的Claude攻克理论物理前沿难题,成功算出平面N=4超杨-米尔斯理论六粒子振幅的九圈结果,打破人类此前保持的八圈纪录,计算成本仅几千美元,展示了大模型在科研领域的突破性能力。

新智元
推荐文章9

「闪电.skill」发布!用Anthropic的方法论把你的产品提速3倍!

本文是花叔对Anthropic工程师Claude提速复盘的深度拆解,公开了Anthropic用AI辅助做产品性能优化的完整方法,花叔还实战验证了这套方法,整理出可复用的「闪电.skill」工具开源放出。

花叔
推荐文章9

从 Jev 到 TierSense, Agent 的「判断层」正在被拆出来 | GAIR Paper 132

本文解读Jev和TierSense项目,提出将Agent判断层从大模型生成中拆分,交给专用轻量模型,介绍TierSense能力、实验数据,探讨专用判断模型优化Agent效率的新方向。

AI科技评论
产品应用8

PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐直接翻近7倍

当前大模型算力需求攀升,高端GPU供给紧成本高,大量PCIe长尾GPU算力因框架适配不足被禁锢。是石科技自研Meta-Infer推理引擎,通过纯软件优化挖掘硬件潜力,让DeepSeek推理吞吐提升近7倍,方法也适配国产GPU。

量子位
开源动态8

清华大学联合无问芯穹开源具身智能云原生纳管平台RLark,5分钟接入、10秒启动任务

本文介绍清华大学联合无问芯穹推出并开源的面向具身智能的云原生纳管平台RLark,解决具身智能多设备、多集群协同管控痛点,大幅降低接入和启动耗时,现已完成跨地域真机实测。

机器之心
推荐文章9

和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?

本文整理拾象邀请多家头部模型厂商一线AI研究员的线下闭门讨论,围绕大模型前沿方向分享业内共识与分歧,涵盖Computer Use、RSI、模型蒸馏、训练数据、数据生意等核心议题,干货密度高。

海外独角兽
推荐文章9

Jev火了,但真正重要的不是Jev | 5Y View

TypeSafe AI发布专用决策模型Jev后引发开发者社区关注,本文跳出Jev本身讨论,重新审视大模型通用生成的默认前提,提出AI计算专用化与任务分工的核心观点,预判AI行业发展趋势。

五源资本 5Y Capital