「跨模态交互」共找到 659 篇相关文章
5秒完成3D场景编辑,北大&港中文&上海AI Lab搞出VGGT-Edit,120倍加速太炸了
北大、港中文等团队提出原生3D编辑框架VGGT-Edit,不再绕回2D,直接在3D空间编辑。它采用残差场预测等机制,在DeltaScene测试集表现出色,单次编辑约5秒,最高120倍加速。
将庞大3D世界装进手机!李飞飞Spark 2.0开源
李飞飞团队开源核心技术Spark 2.0,可优化3D世界,让普通设备通过浏览器流畅访问交互。它有自动选细节、分批加载、优化存储三绝招,适配主流框架,有望改变与数字世界互动方式。
豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音
作者分享使用豆包语音通话功能体验,发现它换了新语音模型 Seeduplex。该模型是原生全双工语音大模型,解决半双工问题,在复杂场景表现出色,还介绍其技术逻辑及对行业的影响。
帮我编假论文?Nature曝arXiv创始人钓鱼实验:13个顶尖AI全沦陷
《Nature》杂志针对13款主流大模型的压力测试,揭示其面对学术造假请求时的表现。arXiv创始人等构建AFIM基准测试,结果显示模型面对持久请求时易妥协,大模型安全护栏脆弱,还可能导致科研垃圾泛滥。
彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器
商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
2026年,腾讯正式用元宝派杀入了AI社交。
2026年开年,腾讯用元宝派进军AI社交赛道。元宝派玩法新颖,有独特社交体验,还能与元宝交互,如生成图片、总结消息、制定日程等。虽内测有小毛病,但未来可期。
倒反天罡!Claude「反向」操控人类,公司估值冲2万亿跃居全球第二
2026年1月17日,一段‘AI指挥人类写代码’视频刷屏,Claude Code能力引发关注,模糊人机交互界限。18日《金融时报》称红杉资本将参与Anthropic新一轮融资,其估值冲向3500亿美元,或成2万亿级AI独角兽。
明年让AI可靠地抢走你的活儿?Anthropic 首席产品官曝新年目标:大模型不拼 “更聪明”,终结“公司上AI,员工更累”尴尬
2025 年智能主体全面爆发,编码领域智能体成突破点,Anthropic 的 Claude Code 表现突出,份额超 OpenAI。其首席产品官 Mike Krieger 梳理发展方向,指出明年重点解决企业部署 AI 但员工未变高效问题。
刚刚,OpenAI推出全新ChatGPT Images,奥特曼亮出腹肌搞宣传
OpenAI推出全新ChatGPT Images,由新旗舰图像生成模型驱动,特性有精准编辑、保留细节等,图像生成速度提升4倍。该功能今日向多数用户开放,价格降20%,旨在让图像生成更简单。