算法发现」共找到 1549 篇相关文章

新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
产品应用7

AI产品先发优势在于用户迁移成本高,持续为用户提供价值是保持竞争优势的关键 | 对话AI智能电子衣橱工具搭搭

文章围绕AI智能电子衣橱工具搭搭展开,介绍其功能、开发逻辑与发展规划。搭搭通过AI算法筛选美图定义美,提供穿搭灵感,注重用户需求。团队投入研发,获客成本低,未来聚焦工具,解决穿搭问题,与用户共建产品。

量子位
算法论文8

为什么GPT-5算得出微积分,却数不清积木?

文章对GPT - 5展开系统化空间能力测评,涵盖8个基准、超10亿token成本。提出“空间智能六维图谱”,发现GPT - 5在MM和SR达人类水平,但MR、PT等方面有短板,还揭示闭源与开源模型在复杂任务上差距小等情况。

深度学习自然语言处理
产品应用7

Claude 开始收“代码审核税”:一条 PR 25 美元,大厂一年或花百万,还得上交整个代码库

3月9日,Anthropic推出代码审查产品Code Review,运行在GitHub和CI流程,按token计费,每次15 - 25美元,速度约20分钟/次,用整个代码库分析。虽能发现问题,但价格贵、速度慢,还遭“既当运动员又当裁判”质疑。

InfoQ
新闻资讯7

我所知道的闫俊杰

文章讲述了MiniMax掌门人闫俊杰的故事。他技术功底深厚,在商汤时提出创新算法成名。创业后,他以AGI为目标搭建人才体系,推出Glow等产品。虽面临DeepSeek竞争等困境,但坚持模型与产品一体化发展。

AI科技评论
新闻资讯7

DeepSeek-V3.2巨「吃」Token,竟然是被GRPO背刺了

DeepSeek-V3.2发布后引起关注,但长思考版本暴露出Token使用效率不佳问题,消耗远超同类模型。这或与GRPO算法缺陷有关,其目标函数存在长度和难度偏置,长度偏置仍是该版本高Token消耗的原因。

机器之心
算法论文8

混合数学编程逻辑数据,一次性提升AI多领域强化学习能力 | 上海AI Lab

上海AI Lab的OpenDataLab团队通过大规模实验剖析RLVR在多领域推理机制。构建多领域评估框架与定制奖励策略,基于Qwen2.5 - 7B系列模型联合训练,有多项关键发现,为构建AI推理模型提供参考。

量子位
算法论文8

大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
产品应用7

AI Agent的未来之争:任务规划,该由人主导还是AI自主?——阿里云RDS AI助手的最佳实践

文章以阿里云RDS AI助手实践为例,探讨AI Agent任务规划该由人主导还是AI自主。实测发现大模型自主规划效果不佳,企业更需稳定可靠,人工规划是最佳选择,还提出用‘混合规划’兼顾灵活与可靠。

阿里云开发者
算法论文8

AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT

斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。

量子位