「自适应推理技术」共找到 4566 篇相关文章
模拟大脑功能分化!北大与港中文发布Fast-in-Slow VLA,让“快行动”和“慢推理”统一协作
北大与港中文研究团队发布 Fast-in-Slow(FiS-VLA)全新双系统视觉 - 语言 - 动作模型,将快速执行模块嵌入预训练视觉 - 语言模型,实现快慢系统一体化。该模型在多平台表现优异,控制频率大幅领先。
AI生图迎来大升级:图像编辑达到像素级!背后团队大多来自Stable Diffusion模型基础技术发明团队
Stable Diffusion缔造者团队创立的 BFL 发布全新图像生成模型 FLUX.1 Kontext,可实现像素级图像编辑。它能以文本和图像为输入,有 Pro、Max、Dev 三版本,已在多平台上线,获用户好评,但也面临竞争。
每周产业洞察 | 《反人类暴行》热播背后:影视“快工出细活”成为现实,工业化技术重构制作流程
北京AIGC视听产业创新中心位于朝阳区东坝乡,是朝阳区推动影视制作基地建设的举措。由多方参与,首创郎园运营,提供六大服务平台,截至2025年8月已汇聚60余家生态合作伙伴。
刚刚,百度抛出“王炸”:全球首个可商用自我演化智能体!李彦宏:技术迭代速度是唯一护城河
在百度世界大会上,李彦宏指出产业结构不均衡问题,介绍AI产业从‘正金字塔’向‘倒金字塔’转变。百度展示内化AI能力成果,如发布数字人、重构搜索、更新秒哒等,还推出昆仑芯、文心大模型5.0和全球首个可商用自我演化智能体百度伐谋。
为防AI刷题,Nature等顶刊最新封面被做成数据集,考验模型科学推理能力|上海交通大学
上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试集,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱
2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。
一次又一次的「开发者要被取代了」的炒作潮,最终却催生了全新的薪资更高的技术岗位
每隔几年就有新技术称能取代程序员,如无代码、云计算等,但实际是催生新岗位且薪资更高。如今AI辅助开发也如此,软件业最宝贵的是架构设计能力,这是AI难以取代的。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。
黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队
Luma AI推出全新图像模型Uni - 1,对标谷歌Nano Banana Pro和GPT Image 1.5。它是统一图像理解与生成模型,多项评测表现出色。背后是不到15人的华人团队,由DDIM之父和CVPR最佳论文作者带队。