「深度研究智能体」共找到 5450 篇相关文章
奥特曼首次透露GPT-5上手体验:在擅长领域感到无力,往后一靠感到眩晕
OpenAI掌门人奥特曼在深度访谈中透露上手GPT - 5的体验,称在擅长领域感到无力、眩晕。他还抛出孩子不会比AI聪明、AI CEO或接管OpenAI等观点,探讨AI竞争及硬件适配问题。
4个月11万用户、Claude Code成了,Dogfooding该被AI公司重视起来了
Dogfooding(内部试用)应被AI创业公司重视。Anthropic推出的Claude Code源于内部工具孵化,经内部使用和场景验证后发布,四个多月获11万开发者用户,其成功说明深度内部试用是竞争优势。
一起聊聊Nvidia Blackwell新特性之低比特GEMM
本文是NVIDIA Blackwell架构GEMM研究系列文章第三部分,介绍低精度计算,探讨Blackwell GEMM如何执行,关注6位和4位格式及对内存布局影响。还提及低精度优势、数据格式、UMMA实现、操作限制、CUTLASS抽象方式等。
借助CoT监管AI?OpenAI、谷歌、Anthropic等罕见联合发文:AI系统安全的新机遇!
OpenAI等支持新研究论文,其指出高级AI不透明性有潜在风险,而‘推理模型’用自然语言推理带来可解释窗口,CoT监控可检测不当行为、发现早期信号等,但也存在使监控性下降的因素。
开放世界任务成功率82%!美的攻克机器人泛化控制难题
美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
文档秒变演讲视频还带配音!开源Agent商业报告/学术论文接近人类水平
澳大利亚和英国多所高校团队提出多模态智能体PresentAgent,能将文档转化为配有语音讲解和同步幻灯片的视频演示。其模块化生成框架有可控性和领域适应性,评估显示它在各指标上接近人类水平。
数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?
论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。
首发丨美团悄咪咪公测 AI 袋鼠参谋 App
美团正在公测AI袋鼠参谋App,它是基于AI大模型决策能力的智能应用,依托海量门店信息和多年运营经验,覆盖4类经营场景,以“数据向决策的翻译服务”帮商家解决开店难题。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。