全图编码」共找到 2374 篇相关文章

开源动态8

从VLA到RoboOmni,模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现面领先。

机器之心
新闻资讯7

5位华人联创走,创始12人只剩3人,马斯克xAI梦碎?

xAI的五位华人联创部离开,其创始人正经历离职潮。公司并入SpaceX 、剑指万亿估值IPO ,资本压力下或致人员变动,马斯克将换人重建,效果未知。

新智元
开源动态8

真实评估!北理发布球首个「场景教育」基准,支持4000+情境

北京理工大学高扬老师团队推出EduBench,是球首个「场景教育」基准,涵盖9大教育场景、12个评估维度、超4000个情境。团队将数据、模型等面开源,评估发现大模型在特殊教育场景有不足,还提出多源知识蒸馏等方法。

新智元
产品应用7

靠Claude4!30年FAANG老工程师:AI帮我解决了4年老bug

5月22日Anthropic推出Claude 4系列大模型,Claude Opus 4是领先编码模型。Reddit上30多年经验的前FAANG工程师称,它解决了困扰自己4年的C++ Bug,引发热烈讨论。

机器之心
算法论文7

多模态模型挑战北京杭州地铁!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
产品应用8

社区供稿 | GLM-4.5技术博客:原生融合推理、编码和智能体能力

文章介绍 GLM-4.5 和 GLM-4.5-Air,二者旨在统一推理、编码和智能体能力。在 12 个基准测试中表现良好,采用 MoE 架构等技术,还开源 slime 框架。文中展示其多方面应用,并说明使用方式。

Hugging Face
开源动态8

最新W4A4KV4量化框架,单卡A100大模型推理速度飙升

计算所王颖研究员团队等联合在ASPLOS 2025上发表并开源COMET框架,通过系统 - 算法协同优化,实现4比特推理性能突破,在多方面有技术亮点,实测性能碾压现有方案且已开源。

AIGC开放社区
推荐文章8

AI科研周期拆解:从选题到宣发,哪里能放手,哪里得盯着

Awesome AI Auto-Research Team 综述梳理 AI 科研周期能力与局限,按四阶段八环节拆解,介绍五种方法范式,指出各阶段应用情况、瓶颈及规律,强调人本治理的 AI 辅助科研才是可信路径。

AIGC开放社区
8

我用MiniMax Agent开发了个带后端的栈网站,程0代码

2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的栈网站。

花叔
新闻资讯7

一人作弊,组「连坐」拒稿! ICML最狠新规,华人大佬挂帅严查

ICML程序主席发布同行评审新举措,包括打击“切香肠”式投稿、“连带直接拒稿”机制、审稿人互惠原则等,若有人论文作弊,组投稿或被拒,2026年会议将由华人大佬挂帅。

新智元