「多模态AI交互」共找到 10506 篇相关文章

新闻资讯8

从Token到词元:全模态时代的基模与交互入口

2026年3月24日国家数据局确立“词元”为Token标准译名,Token生成与消耗方式在多模态场景正发生变化。模思智能获数亿融资,探索从语音到全模态的路径,成果颇丰且完成能力闭环,其发展受关注。

量子位
新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元
新闻资讯7

Meta版「甄嬛传」!28岁天才上位,掌管6千亿命脉,AI教父愤然出走

纽约时报爆料Meta内部正上演“权力的游戏”。扎克伯格得意门生与老将冲突不断,图灵奖得主Yann LeCun或被逼离职。年初Meta还是AI开源王者,现在却面临投入与回报拷问,其最新模型“牛油果”或不再开源。

新智元
算法论文8

谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场

纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。

机器之心
新闻资讯7

老黄再收95后华人才俊!4亿美元收购AI初创公司

英伟达老黄以超4亿美元收购95后华人王尚创立的AI初创公司CentML,员工全部打包带回。该公司能整合软硬件资源,可增强英伟达CUDA工具链。此前老黄已收购多家相关初创公司揽人才。

量子位
产品应用8

锁定角色,「多主体」也可控!个性化文生图,给你PS般交互体验

LayerComposer革新个性化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互性与多主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。

新智元
产品应用8

Vidu Q2的参考生视频,是AI视频多参党的胜利。

作者分享使用Vidu Q2多图参考生视频的体验,认为它是AI视频多参党的胜利,是新工作流范式。Q2在一致性、表演能力和多风格表现力上大幅进化,价格实惠,还推出APP,多图参考生视频未来可期。

数字生命卡兹克
新闻资讯7

ICML2026 | 全新评审政策出炉!作者可选:评审是否使用AI

ICML 2026 为应对预期投稿量,提出互审数量限制和 AI 使用规定。此次引入评审类型选择机制,作者可决定评审是否用大模型,分严格禁止的政策 A 和有限制允许的政策 B,但执行或有困难。

AINLPer
新闻资讯7

万亿美金赛道,迎中国破局者!AI重构新材料,「智造」时代开启

国产自研RhinoWise智能平台可将材料研发周期从数年缩至数月。背后的鼎犀智创完成数千万级融资,其以‘设计–模拟–制备–表征’闭环提升效率,产品将与国内龙头企业合作落地。

新智元
算法论文7

最新研究!大模型“角色扮演”无效了?

沃顿商学院研究测试6个主流AI模型,进行超25000次测试,发现告诉AI扮演专家角色,不会让其回答更准确,反向设定‘低知识’角色有时表现更好,角色扮演不是提高准确性的万能钥匙。

AI工程化