「深度推理能力」共找到 5079 篇相关文章
用“因果规划”解决多智能体协作中的任务依赖难题|港科广&腾讯
港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能体系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务中表现出色,已中稿EMNLP 2025 Findings。
马斯克宣布:Grok学会看片了!无字幕看懂陶哲轩菲奖级难题
马斯克宣布Grok可分析任何视频。它能对伪造视频鉴假溯源,但也有处理画面靠字幕、有幻觉问题和效果不稳定的缺陷。实测中它能理解无字幕视频,还整理访谈内容。这功能虽便利,但引发人类能力退化担忧。
反超Nano Banana!OpenAI旗舰图像生成模型上线
OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。
谷歌新版Gemini一夜端掉UI:单HTML文件复刻macOS,成功率100%
谷歌新版Gemini 3.0 Pro能力惊人,几行提示词就能在浏览器复刻苹果macOS,还能生成网页版Windows、Linux,功能完整且能一次生成,代码已公开。不过有网友指出这只是模拟环境。业内推测其或在未来几个月发布。
Nanbeige4.2-3B:探索通用Agent小模型
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
ICML 2026 Oral | 为3D空间智能数据构建全自动数据飞轮,Holi-Spatial打造400万级空间多模态数据集
来自多机构的研究团队提出 Holi - Spatial,可从原始视频自动生成 3D 重建等数据,构建 400 万级空间标注数据集 Holi - Spatial - 4M,提升 VLM 空间能力,还形成自动化数据飞轮,但存在计算成本高、特定场景表现不佳等局限。
这才叫AI原生应用:Google Slides
Google Slides是Google版AI PPT,与传统AI PPT不同。它像传统PPT搭配AI聊天机器人,用Nano Banana模型可直接生成图片和文字,能像素级推理,打破传统PPT结构,还可自然语言交互修改,只是中文生成效果待提升。
实测可灵O1,AI视频界的Banana也来了。
可灵推出全新多模态视频大模型可灵O1,融合多种视频生成与修改能力。实测显示,它能实现视频内容增删、特定内容修改、扣绿幕、动作迁移、风格更改等功能,虽有局限,但开启用嘴改视频新时代。
实测DeepSeek V3.1,不止拓展上下文长度
文章实测了DeepSeek V3.1和V3,发现V3.1在编程、写作、翻译等方面有变化,如编程更全面、写作风格变文艺等。网友测试其在aider得分71.6%成非推理模型SOTA,但线上API有问题。
通向L3的正确范式?理想i8全球首发VLA高阶辅助驾驶,我们帮你试了试
本周二,理想全新纯电SUV理想i8上市,其搭载的VLA辅助驾驶系统受关注。理想发现端到端数据驱动升级有局限,VLA架构改进让系统有思维、沟通等能力,还带来平顺性等提升,且研发各方面能力强。