视觉 Agent」共找到 3296 篇相关文章

产品应用8

让AI主动干活,给你找服务,鸿蒙“6”啊

在HDC 2025上,鸿蒙展示服务分发展示新能力,能让服务主动找用户。它形成Agent行动网络,推出“探索”服务流。奈雪、东方财富等已加入,华为为开发者提供多种工具及激励政策。

量子位
推荐文章7

从案例分析到提示词写作,手把手教你制作最火爆的AI视频

文章教大家制作火爆的AI视频,介绍爆款分析、创意拓展、提示词生成等方法。用NotebookLM分析视频,Gemini拓展创意,还给出提示词模板。借助Veo3降低成本,最后完成视频生成、合并及后处理。

歸藏的AI工具箱
产品应用8

抢先OpenAI?AIUI全新升级燃爆22亿终端,国内大厂定义智能交互

科大讯飞围绕智能交互场景,对AIUI、机器人超脑等4大平台全面升级。其AIUI以大模型为引擎,有儿童专属交互方案,还推出智能眼镜“三麦阵列”等,各平台在多领域应用成果显著。

新智元
开源动态8

一键抠图有多强?19Kstar 的 Rembg 开源神器,5 大实用场景颠覆想象!

视觉内容需求旺盛的当下,背景抠图工具至关重要。Rembg 是能在本地完成高质量图片背景抠图的开源利器,累积 19.1K ⭐。本文通过项目详解等带你深度了解它的魅力。

小华同学ai
7

强化学习之父:LLM主导只是暂时,扩展计算才是正解

新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。

量子位
开源动态8

重磅开源!首个全异步强化学习训练系统来了,SOTA推理大模型RL训练提速2.77倍

清华大学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。

机器之心
产品应用8

AI编码新神登基,藏师傅一手Claude 4实测

Claude 4低调发布,Anthropic称Claude Opus 4是全球最佳编码模型。发布内容含扩展思维、新模型能力等,还公布定价。Claude Opus 4编码和记忆能力强,实测表现出色,Claude Sonnet 4也有提升且免费。

歸藏的AI工具箱
推荐文章7

清华许华哲:具身智能需要从 ImageNet 做起吗?

清华许华哲探讨具身智能,分析其爆发原因、失败模式及决策点,涉及视觉信号输入、触觉应用、学习方法等,还探讨具身智能是否需‘ImageNet时刻’,并从宏观视角谈智能的共性。

AI科技评论
产品应用8

云知声发布U2-Flash,要争“大模型主力位”|甲子光年

本文报道云知声发布U2-Flash大模型,基于原有U2基座,通过创新后训练方案提升Coding、Agent等复杂任务能力,多项评测比肩头部模型,目标成为企业真实生产任务的主力大模型。

甲子光年
算法论文8

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。

量子位