「复杂推理任务」共找到 4039 篇相关文章
刚刚,清华团队用27M参数击败o3-mini!或将改变AI发展方向
清华大学研究团队发布论文,展示Hierarchical Reasoning Model(HRM)。该模型仅27M参数、1000个训练样本,在推理任务上击败OpenAI的o3 - mini - high,或改变AI发展方向。
Anthropic的多智能体,真的有必要吗?
作者曾质疑多智能体系统,看了Anthropic对「Claude Research」的说明后有了改观。介绍了多智能体系统定义、性能提升、代价,还阐述构建方法、评估方式,公开三个核心提示词及协作模式。
两年内打造AI软件工程师!OpenAI Codex 作者解密人机结对编程新模式
AI科技大本营编译访谈,OpenAI的Josh Ma与Alexander Embiricos分享Codex项目,包括缘起、人与AI结对编程范式,还探讨产品形态、最佳实践等,预测两年内打造智能体软件工程师。
MiniMax M3 实测:第一流的模型,已经对执行层动手了
文章对 MiniMax M3 模型进行多维度实测。它强化 Coding 与 Agent 能力,能完成长任务,与 Sonnet 4.6 竞技各有优势,多模态能力强,价格有竞争力,MiniMax Code 意在争夺开发者工作流入口。
把屁声发给ChatGPT,它说这是艺术
有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。
黄仁勋暴论核弹:AGI已经实现,Ilya错了,程序员有10亿
在Lex Fridman的专访中,黄仁勋抛出诸多惊人观点,如称已实现AGI,反驳Ilya“预训练触顶”言论,认为推理计算难且重要,还对未来技术、行业、职业发展等多方面进行展望。
「豆包手机」被智谱开源了,AutoGLM 实测
豆包手机发布后火爆,智谱开源AutoGLM,能让安卓手机变「AI手机」。作者实测,它能完成点外卖、比价等任务,设计贴心尊重隐私。适合开发者、效率爱好者等,还会推动Phone Agent生态发展。
“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿
Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。
Hugging Face刚刚开源了一个MCP全面指南~
Hugging Face推出免费开源的MCP课程,涵盖从理论学习到实践应用的内容。介绍了无MCP时开发的复杂情况,以及使用MCP可降低集成复杂性和维护负担,还说明了MCP架构的组件。
Meta重组AI团队后首个模型来了:不是最强、不再开源、可能够用
当地时间4月8日Meta发布Muse Spark,是重组AI团队后首个模型。它计算效率有提升,在多模态和健康任务领先,但在编程等场景落后。该模型闭源,适配Meta产品,未来优先产品再生态。