「人类推理」共找到 3125 篇相关文章
刚刚,霸榜神秘视频模型身份揭晓,原来它就是「David」
几天前登上Artificial Analysis榜首的神秘视频模型揭晓,是Runway最新发布的Gen - 4.5。它树立行业新标杆,在多方面表现出色,但也存在一些视频模型常见的局限性,Runway正探索解决办法。
告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent
为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。
谷歌DeepMind最新论文,刚刚登上了Nature!揭秘IMO最强数学模型
谷歌DeepMind的AlphaProof在IMO获接近金牌的银牌成绩。它结合大模型直觉、强化学习和Lean形式化证明解题,虽在速度、泛化和读题上有局限,但开启了人类数学家与AI协作新阶段。
清华团队:1.5B 模型新基线!用「最笨」的 RL 配方达到顶尖性能
清华团队用两个 1.5B 模型证明,用最基础的 RL 配方可达到小模型数学推理能力 SOTA。单阶段训练加固定超参数实现 SOTA 性能且省一半算力,训练曲线还很平滑。
颠覆传统认知!顶尖架构师眼中,决定职业生涯上限的不是技术能力|独家对话一线架构大佬 Christian Ciceri
在软件开发与AI浪潮融合背景下,架构师面临新挑战。InfoQ采访Apiumhub联合创始人Christian Ciceri,探讨‘可度量、可演化的架构’理念及AI影响,Ciceri强调AI辅助而非替代人,架构需团队共创。
国产模型新盛况!王座易主:Kimi K2 Thinking开源超闭源
月之暗面开源 Kimi K2 Thinking 模型,多方面性能超 GPT - 5 等闭源模型。它擅长多轮调用工具和持续思考,在多项基准测试达 SOTA 水平,成本低且授权宽松,引发全网讨论。
离GPT-5最近的一次!中国1万亿参数开源巨兽突然爆火
月之暗面发布全新模型Kimi K2 Thinking,自称开源「思考Agent模型」。它参数约1万亿,性能亮眼,碾压GPT - 5等,能连续调200 - 300次工具,已上线并开源API和权重,开发者可试用。
AI 正在奖励那些「最不专业」的人
文章以AI能力为上涨的潮水、个人专业技能为柱子作比,指出AI先替代简单重复工作,再逐级挑战复杂工作。高精尖专家因专业技能高难,难见AI价值;创业者则受益于AI对琐碎事务的处理。
MiniMax M2 发布即爆,拿下开源模型第一名
10月27日,MiniMax发布新一代文本大模型M2及由其驱动的MiniMax Agent。M2是专家混合模型,参数达230B但激活仅10B。它在开源模型评测中夺冠,能低成本、高速度支撑工作流,开发者评价高。
对话蚂蚁 AWorld 庄晨熠:Workflow 不是“伪智能体”,而是 Agent 的里程碑
文章围绕AI Agent展开,蚂蚁集团AWorld算法负责人庄晨熠认为,当前AI陷入‘应试狂热’,Workflow是智能体发展的里程碑,群体智能与大模型相辅相成,还分享了智能体应用实例及对未来的规划。