复杂推理任务」共找到 4039 篇相关文章

算法论文8

刚刚,清华团队用27M参数击败o3-mini!或将改变AI发展方向

清华大学研究团队发布论文,展示Hierarchical Reasoning Model(HRM)。该模型仅27M参数、1000个训练样本,在推理任务上击败OpenAI的o3 - mini - high,或改变AI发展方向。

AGI Hunt
推荐文章7

Anthropic的多智能体,真的有必要吗?

作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。

AGI Hunt
推荐文章8

两年内打造AI软件工程师!OpenAI Codex 作者解密人机结对编程新模式

AI科技大本营编译访谈,OpenAI的Josh Ma与Alexander Embiricos分享Codex项目,包括缘起、人与AI结对编程范式,还探讨产品形态、最佳实践等,预测两年内打造智能体软件工程师。

AI科技大本营
产品应用8

MiniMax M3 实测:第一流的模型,已经对执行层动手了

文章对 MiniMax M3 模型进行多维度实测。它强化 Coding 与 Agent 能力,能完成长任务,与 Sonnet 4.6 竞技各有优势,多模态能力强,价格有竞争力,MiniMax Code 意在争夺开发者工作流入口。

AI科技评论
新闻资讯7

把屁声发给ChatGPT,它说这是艺术

有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。

量子位
新闻资讯8

黄仁勋暴论核弹:AGI已经实现,Ilya错了,程序员有10亿

在Lex Fridman的专访中,黄仁勋抛出诸多惊人观点,如称已实现AGI,反驳Ilya“预训练触顶”言论,认为推理计算难且重要,还对未来技术、行业、职业发展等多方面进行展望。

量子位
开源动态8

「豆包手机」被智谱开源了,AutoGLM 实测

豆包手机发布后火爆,智谱开源AutoGLM,能让安卓手机变「AI手机」。作者实测,它能完成点外卖、比价等任务,设计贴心尊重隐私。适合开发者、效率爱好者等,还会推动Phone Agent生态发展。

特工宇宙
新闻资讯8

“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿

Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。

InfoQ
开源动态7

Hugging Face刚刚开源了一个MCP全面指南~

Hugging Face推出免费开源的MCP课程,涵盖从理论学习到实践应用的内容。介绍了无MCP时开发的复杂情况,以及使用MCP可降低集成复杂性和维护负担,还说明了MCP架构的组件。

PaperAgent
新闻资讯7

Meta重组AI团队后首个模型来了:不是最强、不再开源、可能够用

当地时间4月8日Meta发布Muse Spark,是重组AI团队后首个模型。它计算效率有提升,在多模态和健康任务领先,但在编程等场景落后。该模型闭源,适配Meta产品,未来优先产品再生态。

DeepTech深科技