过程评估」共找到 1016 篇相关文章

算法论文8

基于LLM的Agentic Reasoning框架综述:从方面到场景的全面总结

近年来,大型语言模型虽能力强但有局限,研究者构建基于LLM的智能体系统。此综述论文提出系统、统一分类法梳理智能体推理框架,建立统一描述语言和通用算法,分析其在不同场景表现与评估方法。

深度学习自然语言处理
新闻资讯8

马斯克星舰试验再创历史!3次爆炸3次推迟终成功,顺利完成太空载荷部署

美国中部时间26日晚,马斯克星舰第十次发射试验圆满成功。此次采用B16+S37组合,历经助推器返回、载荷释放、太空再点火等环节,虽过程波折,多次推迟和爆炸,但终达成目标,向太空探索迈进。

量子位
新闻资讯7

小扎“亿元俱乐部”车门焊死!被曝冻结招聘,禁止内部人员流动

Meta超级智能实验室被曝冻结招聘,禁止员工跨团队调动。此前Meta大举招人,现因新老员工矛盾、AI部门重组及市场对“AI泡沫”担忧等因素调整战略,虽AI投资有收益,但仍需评估

量子位
推荐文章7

深刻理解Token:大语言模型(LLM)是如何看待这世界?

文章指出在大语言模型(LLM)中,Token是处理文本的基本单位。介绍了Token的概念、分词方法、向量化过程,还阐述了分词对模型性能的影响,如导致模型在数学、多语言处理上表现不佳等。

AINLPer
推荐文章8

复盘 ChatGPT:7 亿周活的 ToC 产品,如何在模型之外做增长?

Lenny播客邀请OpenAI的ChatGPT负责人Nick Turley对谈,他分享了ChatGPT从内部项目成长为7亿周活产品的过程,包括产品开发、增长、定价决策等,还阐述了成功原因、增长方法等,为AI创业者带来启发。

Founder Park
产品应用8

DeepRare 重磅发布:全球首个可循证智能体诊断系统,直击医学Last Exam难题

上海交通大学人工智能学院等联合发布全球首个罕见病推理型智能体诊断系统DeepRare。它结合大模型和多智能体架构,模拟医生诊断思维,支持多模态输入,在多数据集评估中表现出色,已上线在线平台。

机器之心
开源动态8

Kimi K2官方技术报告出炉:采用384个专家,训练不靠刷题靠“用自己的话再讲一遍”

Kimi K2官方技术报告公开称霸全球开源模型的秘籍,介绍其训练过程及“秘密配方”,包括MuonClip优化器、大规模Agentic Tool Use数据合成等技术亮点,还提及后阿里通义Qwen3更新击败Kimi K2。

量子位
7

IMO怒斥OpenAI自封夺金,“91位评委均未参与评分”,网友:炒作无下限

OpenAI宣称新模型获IMO金牌不到24小时剧情反转,多位官方人士和大佬指其做法“粗鲁且不恰当”。其“金牌”成绩或站不住脚,未与官方合作,无评委参与评估。此事引发学术道德和商业炒作争论。

量子位
新闻资讯8

「AI重大飞跃」OpenAI官宣:内部实验模型在IMO 2025中取得金牌,GPT-5即将发布

OpenAI研究员Alexander Wei宣布团队开发的内部推理模型在IMO 2025中获相当于人类金牌成绩,还透露GPT - 5即将发布。模型按人类规则评估,解决5个问题,代表AI通用推理能力飞跃,成果不局限于数学推理。

AI寒武纪
算法论文8

大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线