可验证推理」共找到 6130 篇相关文章

新闻资讯8

前OpenAI灵魂人物Jason Wei最新演讲!三大思路揭示2025年AI终极走向

前OpenAI核心研究员Jason Wei在斯坦福演讲,提出AI发展三大思路。他认为智能会商品化、成本下降,自适应算力出现;所有能被验证的任务最终会被AI解决;AI智能呈锯齿状,不会瞬间超越人类。

新智元
开源动态8

智源开源EditScore:为图像编辑解锁在线强化学习的无限

北京智源研究院团队发布 EditScore 高保真奖励模型系列,为图像编辑强化学习提供精确奖励信号。团队提出两步解决方案,开发出 EditScore 系列模型,其在多方面表现优异,还验证了两大应用场景,有深刻研究洞见。

机器之心
开源动态8

开源PDF表单自动化神器,一行命令,把静态 PDF 变成交互表单!

平时拿到的PDF表单大多无法直接填写,操作繁琐。GitHub上的开源工具CommonForms能自动识别PDF表单区域,一键生成填写的交互式表单,基于深度学习模型FFDNet,功能强大且使用简单,还保障数据隐私。

开源星探
开源动态8

全新合成框架SOTA:强化学习当引擎,任务合成当燃料,蚂蚁港大联合出品

蚂蚁通用人工智能中心自然语言组联合香港大学自然语言组推出PromptCoT 2.0,押注任务合成。它让30B - A3B模型在数学代码推理任务达SOTA,全面升级效果、数据和方法,还将考虑多方向发展。

量子位
开源动态7

Qwen又立功,全球最快开源模型诞生,超2000 tokens/秒!

全球最快开源大模型K2 Think诞生,速度超2000 tokens/秒,由阿联酋机构与公司合作推出,基于Qwen 2.5 - 32B打造。实测速度快且答案准确,主要为数学推理开发,团队已发布技术报告。

量子位
开源动态7

谷歌又来砸饭碗!免费AI Agent发布,程序员狂喜

昨天谷歌发布免费开源的AI Agent Gemini CLI,在电脑终端运行。它定位为开源AI Agent,能理解任务、制定计划和调用工具。免费额度慷慨,能力不限于编码,上手简单,但刚发布存在不稳定情况。

探索AGI
产品应用8

智源悟界·RoboBrain Orca:多模态表征世界模型

智源研究院悟界·RoboBrain Orca团队发布技术报告,探索让模型学习世界表征,从‘预测下一个词’走向‘预测下一状态’。它通过多模态数据学习,经实验验证有效,虽处早期阶段,但提出值得扩展的方向。

新智元
推荐文章7

AI最大的礼物,是让你能廉价地失败100次

文章指出AI最大的礼物不是让人成功,而是让人能廉价地失败。AI让开发成本降低、心力节省,增加了尝试机会。但人们需发布产品获取反馈,构建演化系统,让失败为后续铺路。

花叔
产品应用7

Claude Opus 4.7 上手实测:花7倍价格买输出,值不值?

作者实测Claude Opus 4.7,其定价约为GPT - 4.5的6 - 7.5倍。它有全新架构、强化Agent能力等升级,在代码生成、推理分析等多场景表现出色,是否值高价取决于使用场景。

小华同学ai
新闻资讯8

龙虾让位!硅谷顶流AI「爱马仕」一夜闯进微信,冲上全球第一

硅谷新宠Hermes Agent爆火,GitHub揽6.6万星,原生接入微信引开发者关注。其署名的首篇‘顶会级’论文提出Autoreason推理方法,指出传统‘自我优化’弊端,展示出小模型逆袭等优势。

新智元