「长程执行能力」共找到 3625 篇相关文章
6小时复刻AI IMO金牌成果,蚂蚁多智能体新进展已开源
2025年IMO赛场,顶尖大模型起初表现不佳后有突破。蚂蚁AWorld项目团队6小时复现并开源DeepMind解题结果,给出可一键运行系统。AWorld证明多智能体协同优势,还介绍复现思路、核心优势及体验方式。
告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜
DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。
不死的程序员
文章回顾计算机技术演进中八次“程序员替代论”浪潮,从编译器诞生到如今大语言模型崛起。虽每次都预言程序员被取代,但实际是角色重塑、分层,新需求增长超人力节省,程序员价值仍在。
人类下一个奇点,超级智能时代
OpenAI联合创始人Sam Altman在博客《温和的奇点》中表示,人类已越过技术转折点,迈向数字超级智能时代。他预测2025 - 2027年将有系列智能成果出现,到2030年代智力和能源将丰富,虽有挑战但前景乐观。
一篇95页最新80种Deep Research系统全面综述
浙大研究深度研究系统领域,分析自2023年以来80多个相关实现,提出4维度分层分类法,全面分析4种实现架构,还阐述各维度演变进步。
TransDiff--最简洁的AR Transformer + Diffusion图像生成方法
文章分享图像生成新方法TransDiff,它结合AR Transformer与Diffusion,提出MRAR范式。通过Q&A解答其使用Transformer原因、小Diffusion Deocder效果等问题,还指出它有连续帧生成潜力,将用于视频生成。
CVPR 2025 Highlight|北大联手智元发布首个基于说明书的家电操作评测基准
北大联合智元团队提出全新家电操作评测基准 CheckManual,被 CVPR 2025 接收并评为 Highlight。它有拟真说明书与多样资产、契合实际的评测任务、首个操作规划模型 ManualPlan 等优势,还做了相关实验。
240 款 AI 软件定价分析:从席位到成果,AI 定价的五种趋势
国外科技作者 Kyle Poyar 收集超 240 家软件公司数据,分析 AI 软件定价。指出传统定价面临挑战,混合定价成主流,还介绍常见策略、结果定价问题、价格透明化困境及企业准备不足等情况。
从browser-use 出发,品 Agent 实现
本文作者以学习总结视角,从browser - use出发解析Agent实现。介绍LLM不同阶段,阐述Agent记忆、规划、工具等要素,通过对话演示和源码分析展示运行机制,还探讨MCP集成和Coze space应用模式。
对话西工大徐韬:昇腾生态如何为AI创新装上涡轮增压?|甲子光年
本文讲述西工大徐韬团队与昇腾平台深度合作的故事。他们从算子研究攻坚底层技术,开发抑郁症初筛等系统。昇腾还助力教学,让学生实践操作。未来,更多人将参与国产AI源头创新。