多模态任务」共找到 2696 篇相关文章

新闻资讯8

独家专访临界点CEO乔天杰:机器人运动会7冠背后,灵巧手真正该比什么?|甲子光年

8月22 - 26日,第二届世界人形机器人运动会举行,灵巧手首次单独参赛。临界点携OmniHand获7金4银3铜,CEO乔天杰接受专访,探讨灵巧手能力衡量、自由度、工程化及产业应用等问题。

甲子光年
新闻资讯8

ChatGPT最强网络安全模型,逼谷歌紧急修漏洞!

OpenAI推出安全专用模型GPT-5.6-Cyber,用于处理信息安全任务。它战绩斐然,发现诸多内核漏洞。Daybreak计划为安全人员提供工具。该模型虽有不足,但展现出强大的网络安全能力。

新智元
算法论文8

GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?

PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。

深度学习自然语言处理
推荐文章7

为什么你的 AI Coding 账单越涨越快?十个节约 Token 的工程办法。

文章指出今年大模型Token账单涨得快,尤其AI编程重度用户。从工程角度总结降低Token消耗的方法,如上下文清场、代码导航等,还分析AI Coding的Token变贵原因及各方法适用边界。

AI大模型应用实践
产品应用8

阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天

阿里发布原生流媒体端到端模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备端到端多模态统一、低延迟等特点。

开源AI项目落地
算法论文8

从「说错话」到「干错事」:复旦、CityUHK、SMU、UIUC等13家机构联合发布「具身智能安全」综述

具身智能正从实验室走向现实世界,却带来‘干错事’的现实风险。13家机构38位学者联合发布70+页综述,提出‘能力—风险’二象性,梳理各能力层攻击面与风险,还指出研究空白,维护开放资源生态。

机器之心
产品应用8

Kimi推出超实用插件!让AI真正像你一样操作浏览器

月之暗面推出Kimi WebBridge浏览器扩展插件,让AI Agent像用户一样操作浏览器。它采用本地优先路线,保障安全,可实现信息采集等自动化操作,还能创建CLI工具,是AI浏览器自动化趋势的重要成果。

AIGC开放社区
推荐文章7

Karpathy公开附议:AI Agent 的输出格式,正在从 Markdown 走向 HTML

随着 Agent 处理任务变复杂,Markdown 在长文档中可读性与排版局限凸显。HTML 能无损表达信息、支持双向交互,但生成耗时久、版本控制难。AI 研究者 Karpathy 附议,HTML 成探索方向。

深度学习自然语言处理
新闻资讯8

ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了

Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。

AI前线
算法论文8

让大模型自己写代码、自己进化,GIM和港大这篇ACL主会,把量化因子挖掘重做了一遍

香港大学和GIM提出CogAlpha框架,将Alpha从‘公式’升级为‘代码’,搭建7层21个智能体探索体系,让大模型参与研究流程。在5个数据集上跑赢21个基线方法,还具可解释性。

机器之心