指令集」共找到 804 篇相关文章

新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
产品应用8

Uber Hive 联邦架构:1.6 万数据、10PB 数据去中心化,支撑大规模分析零停机

Uber重新设计Hive数据仓库,将超16000个数据、超10PB数据去中心化部署,解决可扩展性等挑战。采用基于指针方案迁移,系统含四大组件降低运营风险,还减少存储开销,提升生态弹性。

InfoQ
算法论文8

为防AI刷题,Nature等顶刊最新封面被做成数据,考验模型科学推理能力|上海交通大学

上海交通大学王德泉教授课题组提出MAC基准,用顶级期刊最新封面构建测试,评测多模态大模型能力。研究设计两种含“语义陷阱”的测试任务,发现顶尖模型有局限,还提出DAD方法提升表现,采用双重动态机制。

量子位
算法论文8

三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动

家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接成到机器人,完成复杂任务。

机器之心
算法论文8

X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据上均达SoTA

中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据达最优,为图像分割研究开辟新方向。

机器之心
开源动态8

美团开源LongCat-Image,6B参数挑战80B效果,中英双语理解、图像逼真度及复杂指令编辑新突破

美团开源6B参数图像模型LongCat-Image,在双语文本理解、图像逼真度及复杂指令编辑任务中表现出色。它以轻量化设计超越大模型,还解决中文文本渲染难题,有精确图像编辑能力,且提供全链路开源方案。

AIGC开放社区
算法论文8

绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%

JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。

深度学习自然语言处理
算法论文8

拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力?

现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据和三阶段训练,在修图上表现出色,意义超图像编辑。

机器之心
算法论文7

人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架

人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。

CourseAI
开源动态8

我们对 Coding Agent 的评测,可能搞错了方向

用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测,结果显示模型过程规范遵循不足,未来训练需引入过程监督。

Founder Park