「人类推理」共找到 3105 篇相关文章
人类研发时代结束?XYZ最强Search Agent横扫七大榜单,300个Agent跑通AI4AI全栈闭环
近日,XYZAI Lab发布两款Deep Search Agent,刷新多项评测SOTA成绩。其背后是新型AI4AI研发范式,让AI驱动研发闭环。XYZ团队用AI解决多方面问题,在Deep Search验证,未来有望拓展更多场景。
Agent学会自己「长」Skill了!从失败里长出经验,比人类写的更好用|ICML 2026
ICML 2026接收论文提出EvolveR,让Agent从自身成败轨迹自动蒸馏“经验”,经闭环生命周期形成“认知Skill”,维护经验库,用强化学习让其学会“使用经验”,在多跳问答表现优。
每周产业洞察 | 《反人类暴行》热播背后:影视“快工出细活”成为现实,工业化技术重构制作流程
北京AIGC视听产业创新中心位于朝阳区东坝乡,是朝阳区推动影视制作基地建设的举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月已汇聚60余家生态合作伙伴。
为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学
上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。
喜当爹后,奥特曼自曝神经化学骤变!养娃能为人类做出更优AI决策
OpenAI CEO奥特曼喜当爹后称优先事项改变,神经化学有骤变。其决策能力曾受争议,现恰逢OpenAI推进“星际之门”计划,他还将AI发展比作看孩子成长,也提及行业或有泡沫。
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱
2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。
Wabi 创始人的 7 个预测火了,给 AI 而非人类做的数据库ARR 一年涨了6 倍
Wabi创始人Eugenia Kuyda《Consumer AI predictions》总结7个消费端AI产品预测,如无屏幕和全时监听设备难成功、2030年AI机器人细分、效果营销将死等。还有一给AI的数据库产品,ARR一年涨6倍。
反超Gemini 3!马斯克放出Grok4.1快速推理版,还曝出了新一轮150亿美元融资
Grok4.1被Gemini 3反超后,据华尔街日报爆料,xAI正计划150亿美元融资,公司估值将达2300亿美元。xAI成立两年多来估值飙升,马斯克还发布Grok 4.1 Fast击败Gemini 3。