可脚本化」共找到 4601 篇相关文章

开源动态8

给几何图片写标题就能让AI更聪明,UIUC发布高质量几何数据集

随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
开源动态8

字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转为结构数据。

字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转为结构数据。它有卓越性能和多种特性,还提供安装、推理使用指南。

GitHubStore
算法论文8

网络顶会获奖!华为提出端网协同RDMA传输架构,解决大规模AI集群网络扩展性问题

全球网络通信顶会 ACM SIGCOMM 2025 落幕,华为与港科大合作的 DCP 研究成果获奖。该论文提出数控分离传输架构 DCP,解决大规模 AI 集群网络扩展性难题,实验显示其性能优于现有 RDMA 方案。

机器之心
算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成运行的符号环境

为让模型真正“能行动”,需执行、验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新能。

机器之心
算法论文8

统一视觉多模态与多任务!快手灵与港科大团队发布视频生成模型,加速真实世界理解

港科大、港中文、清华和快手灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实控,还实现零样本泛,在多任务表现优异。

量子位
产品应用8

阿里云发布为Agent而生的全新AI产品官网“千问云”,模型服务全面Skill、CLI

5月20日,阿里云在2026阿里云峰会上发布全新AI产品官网“千问云”,提供150多款主流模型API,将模型服务核心能力封装为Skills和CLI工具,方便Agent调用,还提供便捷用量管理和多种付费模式。

阿里云开发者
算法论文8

POF | 西交大陈泽伟、陈刚等:面向变形域非周期非定常流动的几何自适应时空深度学习框架

西交大陈泽伟、陈刚等人提出ViT - STFlowNet框架,用于变形域非周期非定常流动预测。该框架融合自适应网格变换与ViT架构,克服传统方法局限,测试显示预测精度高、泛能力好,为飞行器流场感知控制提供工具。

力学与人工智能
开源动态8

一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事视频生成

新加坡管理大学等提出开源全能多智能体框架UniVA,统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。

AIGC开放社区
开源动态8

登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变交互4D世界

全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字门槛,引发行业关注。

机器之心
开源动态8

标准3D生成质量榜单来了!首创层次评价体系,告别“谁的demo更吸睛”主观评估

Hi3DEval团队推出面向3D内容生成的全新层次自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。

量子位