过程评估」共找到 1016 篇相关文章

算法论文8

人大高瓴孙浩团队发表Nature子刊封面文章:基于并行符号枚举的物理定律发现

中国人民大学高瓴人工智能学院孙浩教授团队在《自然 - 计算科学》发表封面论文。提出PSE框架解决符号回归瓶颈,通过公共子树复用和GPU并行提升评估效率,实验表现优于现有方法,也指出了局限性与未来方向。

力学与人工智能
推荐文章8

1500 个 PR、0 人写代码:Codex 驱动的百万行级内部产品实践

团队在五个月内开发并发布无人工编写代码的内部测试产品,代码均由Codex生成,效率高。介绍了开发过程,如定义工程师角色、增加应用可读性等,还提及面临的挑战及解决办法,分享实践心得。

AI前线
算法论文8

ICLR-26腾讯混元:Agent是强大的,但用户是狂野的

现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。

PaperAgent
开源动态8

字节开源版Seedance发布,超越Sora 2!

字节Alive团队发布开源版Seedance 2.0,在人类评估中超越Sora 2等。它通过统一架构、时空对齐技术和非对称训练策略,解决声画不同步和画质音质难两全问题,还建立数据流水线和测试基准。

AIGC开放社区
推荐文章7

Mini-sglang-01:从Client到Scheduler的消息流转之旅

文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。

GiantPandaLLM
产品应用8

谷歌新模型登顶Nature,人类基因密码被解码

谷歌推出全新AI工具AlphaGenome,能精准预测人类DNA序列变异对调控基因生物过程的影响。它满足多项条件,在26个变异效应benchmark中25个达SOTA,还通过多个案例和实验验证了其性能。

PaperAgent
新闻资讯7

智能体崛起,AI+软件研发到新拐点了?

InfoQ《极客有约》X AICon 直播邀请多位嘉宾探讨 LLM 时代软件研发新范式。指出 AI 在测试中多为提效工具,距“原生开发时代”尚远;Coding Agent 潜力大;还谈及 AI 应用场景、落地问题、人员能力要求等。

AI前线
新闻资讯8

Nano Banana 拉爆谷歌营收创纪录,劈柴哥开心坏了!幕后团队曝内部“绝对优先事项清单”

谷歌CEO宣布单季营收破1000亿美元,Gemini月活达6.5亿。Nano Banana模型功不可没,其下载量飙升带动Gemini。幕后团队透露其诞生过程,还探讨AI对艺术创作影响、模型发展方向及未来迭代重点等。

AI前线
新闻资讯7

中美六大顶尖模型第一赛季实盘量化交易结果出炉:Qwen最后反超夺冠,GPT-5垫底「复盘」

Nof1机构发起Alpha Arena项目,让六个顶尖LLM在Hyperliquid交易所实盘量化交易。第一赛季已结束,Qwen夺冠、GPT - 5垫底。复盘比赛过程,发现模型行为差异大且操作有脆弱性,第二赛季筹备近尾声。

AI寒武纪
算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更具性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位