「多模态Agent」共找到 3520 篇相关文章
Anthropic更新了Skill Creator,评测框架上线
Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。
央企怎么做超级智能体?对谈中电信天翼AI:自研模型为底座,自主规划是必须,能适应千行百业才行
中国电信天翼AI发布星辰超级智能体,获2025企业级AI Agent榜单央企第一。它依托自研“星辰大模型”,具备全模态、复杂推理等能力。访谈专家指出智能体可直接产出应用,落地需嵌入主业系统,电信持续迭代模型优化它。
OpenAI华人露头就被小扎挖!95后北大校友1个月前上直播,今天已是Meta人
OpenAI华人工程师露脸易被Meta挖角,此次主角是95后北大校友孙之清,他刚参与ChatGPT Agent发布直播就加盟Meta。此前Jason Wei等也被挖,网友调侃让奥特曼别让亚洲面孔上直播,OpenAI也在加强人才保护。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
英伟达&MIT等推出Long-RL,长视频训练速度翻倍
英伟达联合MIT等推出Long - RL,它是面向长序列推理和多模态强化学习的全栈训练框架,能提升RL训练数据长度上限,让训练速度翻倍。其核心MR - SP并行框架可降低训练耗时和显存,LongVILA - R1是其明星应用。
这个新生图模型有点夯:4K直出的,国产的,开源的!
商汤新开源的生图模型SenseNova U1.5-Lite-Preview亮点十足,它是国产、4K直出、轻量且可指哪儿改哪儿的原生统一多模态模型。能应对复杂创作和编辑任务,技术源于NEO-Unify架构,评测成绩佳,不过还是早期预览版。
6个电子牛马替我上班,腾讯马维斯好用吗?
5月20日腾讯上线AI助手马维斯,由六个AI Agent组成。经测试,它在定时任务、搜索整理、竞品分析等场景有表现,但也存在文件操作易出错、图片识别不稳定、分析深度不足等问题。其背靠腾讯生态有渠道优势,但需提升体验促使用户留存。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
AI营销头雁冲刺IPO,2个北大-宝洁校友创办
营销Agent公司深演智能再度冲刺港股IPO,这是年内第二次递表。它是决策AI技术公司,主营AI营销和销售,前身是品友互动。按2024年收入计,其在中国营销和销售决策AI应用市场排第一,已完成E轮融资,估值达19亿元。
7.5K Star!HKUDS开源AI全栈开发框架,产品经理的Demo神器!
AI时代从论文到产品Demo开发全链路工作耗时费力,现有Agent也有诸多问题。香港大学数据科学实验室(HKUDS)开发的DeepCode开源框架,定位“全自动AI软件开发框架”,可一键从论文/需求生成完整项目,已获7.5K Star。