「多模态处理」共找到 1791 篇相关文章
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
涌现之谜:AI如何像人一样思考与表达?
文章探讨AI如何像人一样思考与表达。早期自然语言处理受通用语法理论影响,但面对真实语言复杂性存在困难。人类经历第一次认知革命实现思维转变,AI也需足够大规模才能涌现复杂能力,“大”或是智能第一性原理。
苹果春季新品奔着龙虾来了!AI性能暴涨8倍,8499元起
苹果发布MacBook Pro M5系列、MacBook Air M5笔记本,8499元起,还更新了显示器。新款MacBook Pro搭载M5 Pro和M5 Max芯片,AI性能大幅提升,提示词处理速度快4倍,图像生成速度快8倍,存储、续航等方面也有优化。
Nano banana手办玩法火爆出圈!无需抽卡,效果惊了(°o°)
小某书被AI手办图刷屏,原来是谷歌的nano - banana(Gemini 2.5 Flash Image)模型爆火。文章实测其手办玩法,还介绍多种玩法,团队透露以文本渲染评估、原生多模态等核心技术,谷歌未来想整合模态实现AGI,还将举办黑客松。
接入 MiniMax M2.7 后,我的 OpenClaw「超进化」了
作者实测 MiniMax 新模型 M2.7,其在基准测试、代码能力、多智能体协作等方面表现出色。接入 OpenClaw 后,能高效完成复杂任务。M2.7 指令遵循率高、长上下文处理能力强且价格低,有望提升 Agent 生态表现。
国产LLM大爆发的一周,Hugging Face热榜被承包了!
这一周国产开源LLM集中爆发,GLM - 4.5、Qwen3的5连发、Step3等接连发布。GLM - 4.5是新一代开源SOTA模型;Qwen3各版本在不同能力上提升显著;Step3是多模态推理模型;腾讯还发布了混元3D世界模型1.0。
香港科技大学、Manycor开源空间大模型,超3000颗星
香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
昆仑万维开源的SkyReels-V3,把马斯克请来带货了
1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域迭代快,此次开源或加剧竞争。
具身智能开始进入「下半场」:从会干活到干完活
具身智能正处热门,国内今年上半年赛道融资额高涨。但钱与落地有落差,拉格朗日具身技术自研 Agentic OS,采用分层智能架构处理工程问题。还推动工序重构,制定技能矩阵和排期计划,其团队背景多元,赌让机器人干完活路径。