多模态视觉作品」共找到 1464 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则

文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。

机器之心
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展迅速,现有检测方法难满足需求。最新综述提出「事实保真度验证」目标,梳理出视觉与语言双视角的四层检测框架,还分析了检测方法演进、评测指标和数据集,为AI视频检测提供落地地图。

新智元
新闻资讯8

AI破解500年《纽伦堡编年史》天书!仅用1小时,隐藏惊天真相被揭开

500年前《纽伦堡编年史》中的手写注释难倒人类学者,Gemini 3.0 Pro仅用1小时就给出解读,识别出注释与圣经年代学体系计算有关。它攻克视觉识别、解读缩写、还原历法转换表三大难题,展现惊人能力。

新智元
新闻资讯8

前小米 OS 高管创业:你的下一部「手机」未必是手机

前小米OS高管董红光创立光帆科技,他认为AI将重塑消费电子行业,未来交互是“需求式”和“多模态”的,手机或不再是最适配设备,穿戴设备或先变革,未来多设备联动由AI大脑调度。

Founder Park
新闻资讯8

Google 发布 Gemini 3.1 Flash-Lite:每秒 363 tokens,百万 token 只要 $0.25

Google发布Gemini 3.1 Flash-Lite,输出速度达363 tokens/秒,比上一代快45%,首个token响应快2.5倍。价格降低,输入$0.25/百万tokens,输出$1.50/百万tokens。跑分不错,还有动态思考功能,支持多模态输入。

AGI Hunt
产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
产品应用8

豆包大模型 Seed 2.0,有点不一样

大模型升级频繁令人审美疲劳,但豆包大模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。

刘言飞语
新闻资讯7

融资35亿后,Kimi神秘模型现身竞技场

大模型竞技场上,神秘模型Kiwi - do现身,自报来自月之暗面Kimi。网友推测它可能是K2 - VL,其通过VPCT测试或改变多模态Agent格局。2025年末Kimi获35亿融资,将用于K3模型研发。

量子位
开源动态8

推理快30%,性能超过千亿参数模型,15B模型Apriel-1.6重新定义端侧推理

ServiceNow人工智能团队发布的Apriel-1.6-15b-Thinker,以150亿参数体量,多模态推理能力强,推理Token消耗降超30%。它在AI分析指数成绩佳,优化计算成本,还介绍了训练策略与多维度性能实测情况。

AIGC开放社区
开源动态8

全球首次,「AI记忆」开源落地!MIRIX同步上线APP

加利福尼亚大学圣迭戈分校博士生王禹和纽约大学教授陈溪联合推出并开源全球首个多模态、多智能体AI记忆系统MIRIX,还上线桌面端APP。MIRIX性能远超传统方法,首次将记忆分六模块,用多智能体系统控制。

新智元