「多模型 Agent」共找到 11011 篇相关文章
浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26
浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。
深度解读|LLM Wiki 的工程实践,从 AI Coding、Obsidian 到 RAG 协同。
文章介绍 LLM Wiki 工程实践。包括为 AI Coding 创建知识地图,指导 Agent 加载上下文;在 Obsidian 构建知识体系,有插件和自定义 Agent 两种方法;还分析其与 RAG 关系,指出可融合互补,不要过度神话 LLM Wiki。
美国解除Claude禁令,Fable 5与Mythos 5即将恢复访问
美国商务部解除针对Claude Fable 5和Claude Mythos 5的出口管制,Anthropic将恢复两款模型访问权限。此前因安全担忧模型被限制,政策逐步松动后现整体解禁,Anthropic还发布了Claude Sonnet 5。
A社你解释下,啥叫Sonnet 5比Fable 5还贵?
Anthropic推出新版性价比模型Sonnet 5,定位为“最能干活”,能力提升但价格暗藏玄机。开发者实测发现,新分词器使Token消耗增加,实际花费可能比Opus还高,且有性能相近但价格更低的替代模型。
极客部落 OPC 入驻路演评审,首批AI创业共建者加速集结
5月8日,极客部落OPC入驻路演评审活动举办,旨在筛选首批入驻团队。活动邀请多部门代表评审,路演项目覆盖多领域,采用多维度评分机制,后续将确定入驻名单,极客部落会持续支持AI创业者。
一张4090就能爆改!面壁智能MiniCPM-V 4.6开源,1B多模态卷出新高度
今年是AI应用大规模落地年,参数小的端侧模型有特定场景性能优势。5月11日面壁智能开源MiniCPM-V 4.6,参数仅约1B,多模态能力超阿里、谷歌同类模型,还在多维度提升,站稳端侧多模态开源领域。
刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA
普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。
阿里云飞天企业版X平头哥“真武”芯片,推理性能跃迁13倍,底层逻辑是什么?| Q推荐
过去几年,模型虽强但使用成本高,阻碍企业级AI深度应用。今年‘模型推理’成AI关键词,4月13日19:00,InfoQ联合阿里云邀专家围绕推理加速底层破局展开对话,探讨算力博弈、芯片性能跃迁等问题。
Meta 放出大招:让 AI 实现自我进化,Karpathy 的 autoresearch 沦为小弟
Meta联合多机构发布论文,提出HyperAgents框架,让AI不仅改进自身,还能改进「改进自己的方法」。它打破传统AI自我改进瓶颈,在多领域测试表现出色,还自发形成记忆机制,有迁移和叠加效果。
Mini-sglang-01:从Client到Scheduler的消息流转之旅
文章围绕轻量化大模型推理系统mini - sglang,详细介绍消息从客户端经APIServer、Tokenizer到Scheduler的流转过程,分析核心组件功能、消息体系、正反向链路及优化策略,还预告后续分析调度和模型实现逻辑。