叙事理解」共找到 860 篇相关文章

新闻资讯7

Claude两个新模型实测流出!空间推理封神,算力直接榨干了

Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。

新智元
8

Loop世界模型论文登顶Hugging Face,来自中国一家初创,周鸿祎陆奇都投了

Prompt还没退场,Loop已开始接管AI叙事。Loop Engineering突然爆火,而Looped World Models(循环世界模型)技术含金量更高,其论文登上Hugging Face Papers当日Top1。该论文由中国初创公司脸谱心智完成,成果显著。

量子位
产品应用8

比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线

大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。

机器之心
算法论文8

从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用

近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。

量子位
新闻资讯7

Kubernetes 被 AI 打回“半成品”!K8s 之父发出警告:代码生成越快,程序员越危险

Kubernetes联合创始人Brandon Burns表示,AI让Kubernetes回到‘未完成’状态,它得适应GPU调度等新需求。他还谈到AI对编程工作的影响,如代码审查成核心技能,未来编程语言或为AI设计。

InfoQ
算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。

机器之心
开源动态8

诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计

过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。

机器之心
新闻资讯8

再封神!OpenAI掀翻AI图像生成,极度逼真,立刻商用

网传OpenAI的GPT-image-2正在灰度测试,韩国网友测试后称其生成图像可‘立刻商用’。它深度融合GPT大语言模型,生成照片更逼真,强化了提示遵循和场景理解能力,让AI图像生成进入‘实用时代’。

AIGC开放社区
新闻资讯8

Claude Opus 4.7连夜突袭:或将抢走全球7亿打工人饭碗!

Anthropic正式发布Claude Opus 4.7,定义为当前可广泛使用的最强Claude模型。其核心升级在复杂任务执行、高清视觉理解和长链路工作流,视觉能力大幅提升,在多方面超越对手,普通用户使用有三大变化。

新智元
开源动态7

智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草

近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。

PaperAgent