「3D场景理解」共找到 4192 篇相关文章
Qwen深度研究一夜升级!可生成网页和音频播客,新模型能认医生手写体
Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。
跨越落地鸿沟!清华长三院发布首个真实场景AI竞技场,实战谁是最佳?
2026年AI产业冰火两重天,清华长三角研究院发布RWAI开源框架与“真实场景AI竞技场”。RWAI还原真实交互,实践效率高。竞技场重实际效能,产生多个赛道“擂主”,降低产业AI落地试错成本。
清华Nature发布惊人结论:AI写论文3倍速,但科学边界被锁死
2026年1月,清华徐丰力、李勇教授联合芝加哥大学团队在《Nature》发文,分析4100余万篇论文发现,AI提升科学家个人生产力,但收缩科学探索集体疆域。团队提出「全流程科研智能体系统」破局。
长尾的复兴
作者曾认为3D打印在制造业是旁支末流,天花板低。如今看法转变,认为AI加3D打印将长尾从比特推进到原子,长尾社区也成熟,让小众需求有规模化满足可能,创客和业余爱好者迎来复兴。
手机也能跑,腾讯混元一口气开源4款小模型
腾讯混元团队开源4款小模型,最大7B。可在低功耗场景运行,支持微调。是融合推理模型,有快、慢思考模式,在多领域表现出色,亮点是agent和长文能力,已落地多元业务场景。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
不上云、不租卡,如何优雅地在本地微调Qwen-VL-30B?
文章指出企业训练多模态助手,30B 参数的开源多模态模型如 Qwen-VL-30B 是不错选择,但多模态场景下显存需求大。联想 ThinkStation PGX 解决了显存难题,还介绍其性能、优势、适用场景及服务等。
从扭秧歌到跑半马:机器人离「iPhone时刻」还有多远?
过去半年,机器人表演把人们认知拉进现实。当下具身智能赛道玩家关注缩短探索周期、降低成本。地瓜机器人发布 RDK S100 套件,其有独特设计和适配场景,还围绕开发者诉求提供支持,跑通多种场景。
Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞
多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。
苏妈联手OpenAI,AMD发布3nm怪兽MI355X,性能碾压英伟达B200!
AI芯片战争白热化,AMD在大会发布3nm工艺的MI355X,推理性能超英伟达B200,还公布明年推出的MI400系列等新品。OpenAI CEO称将用AMD芯片,AMD与OpenAI开启合作。