数学研究目标」共找到 2669 篇相关文章

产品应用7

Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说

阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 多项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。

AI前线
新闻资讯7

中美六大顶尖模型第一赛季实盘量化交易结果出炉:Qwen最后反超夺冠,GPT-5垫底「复盘」

Nof1机构发起Alpha Arena项目,让六个顶尖LLM在Hyperliquid交易所实盘量化交易。第一赛季已结束,Qwen夺冠、GPT - 5垫底。复盘比赛过程,发现模型行为差异大且操作有脆弱性,第二赛季筹备近尾声。

AI寒武纪
推荐文章8

Sam亲自泼冷水,GPT-5意外失手:我们对AI的期待,是否已被整个行业误判?

科技行业集体转向 AI,高管强调其变革性,可 OpenAI 的 Sam Altman 却泼冷水,提醒投资者高估回报。文中围绕‘AI 是否放缓’展开讨论,还分析了 GPT - 5 发布遇冷原因、AI 对就业影响等,指出 AI 发展多且快,未来潜力巨大。

InfoQ
产品应用8

99%的AI产品都没有真正的护城河,初创产品需要做好「细分场景+生态协同」 | 对话AI播客工具Podwise

量子位智库对话Podwise创始团队,探讨AI播客工具发展。团队分享Podwise目标用户、场景、优势,如转录准、能识别声纹等。还谈及产品开发、付费、用户增长等策略,强调做好细分场景与生态协同。

量子位
开源动态7

「看」能否取代「读」,为何DeepSeek-OCR 爆火的重点不在性能?

DeepSeek近期开源的DeepSeek - OCR在AI社区引发热议。它提出‘上下文光学压缩’理念,以视觉方式压缩文本。社区关注重点在其研究思路对NTP范式的影响,有望解决长上下文经济性难题等。

机器之心
算法论文8

Anthropic、Thinking Machines Lab论文曝光:30万次压力测试揭示AI规范缺陷

Anthropic和Thinking Machines Lab等机构研究人员提出模型规范压力测试法,基于细粒度价值体系生成超30万个查询场景,分析12个前沿大模型回答,揭示模型规范存在原则冲突、解释歧义等缺陷。

机器之心
算法论文8

北大彭一杰教授课题组提出RiskPO,用风险度量优化重塑大模型后训练

北大彭一杰教授课题组提出 RiskPO,解决大模型后训练陷入「均值陷阱」问题。它将风险规避理念融入优化目标,用「关注奖励分布左尾」替代「追求整体均值」,在多领域数据集上表现超越 GRPO 等。

机器之心
算法论文8

谢赛宁新作:VAE退役,RAE当立

谢赛宁团队研究表明VAE时代结束,RAE将接力。RAE是用于扩散Transformer训练的新型自动编码器,能提供高质量重建结果,有语义丰富潜空间,支持可扩展架构,收敛快,在ImageNet图像生成效果强劲。

量子位
推荐文章7

AGI 路线图第二阶段:游戏即模型训练|AGIX PM Notes

文章围绕AGI展开,介绍AGI路线图第二阶段“游戏即训练”,指出游戏是训练agent的理想环境;还提及Dreamer系列研究进展。同时涵盖本周市场动态、多家公司AI动态及ETF复制指数的方法、优劣和影响。

海外独角兽
算法论文8

告别微调!斯坦福提出Agentic上下文工程

当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明新方向。

深度学习自然语言处理