长视频理解」共找到 2145 篇相关文章

7

突然变强!速度翻4倍,GPT Pro惊现「神级」操作,网友怀疑GPT-5.5已就位

OpenAI悄悄完成GPT Pro模型升级,其速度提升、视觉理解能力增强。同时,代号「Spud」的GPT - 5.5已完成预训练,发布在即,AI竞争将更激烈。

新智元
新闻资讯7

癌症有救了?AI设计药物开启人体试验,DeepMind「秘密武器」引爆革命

DeepMind分拆的Isomorphic Labs宣布,首批基于AlphaFold发现的候选药物进入人体临床试验,解决了新药研发周期、成本高的痛点,标志AI制药从理论迈向实践。

新智元
开源动态8

多模态开发革命!Gabber开源:图形化构建实时AI应用,效率提升10倍!

AI应用迈向多模态交互,传统开发方式周期。开源项目Gabber是实时AI应用引擎,通过模块化与图形化简化开发,有诸多特性,还给出安装指南,适用于多种场景。

开源星探
开源动态7

5 分钟上手「AI 版 Chrome」,小红书发帖全程零人工,反检测封神

自从Manus产品发布,Agent赛道火热,不少大厂和创业者涌入。如今有浏览器Agent开源方案opendia,它有智能页面理解等AI能力,能用于社交媒体互动等多方面。

CourseAI
开源动态8

本周5个yyds的Github开源项目,速速收藏!

文章介绍本周5个Github优质开源项目。有基于云服务的CloudPaste,排版强的Quarkdown,视频下载工具Media Downloader,双语翻译插件FluentRead,还有全能安卓助手LinkAndroid,各有特色功能。

开源先锋
产品应用7

别难为 ChatGPT 了!面对海量资料,NotebookLM + Gemini 的“外挂模式”才是降维打击

Google打通NotebookLM和Gemini后,二者协作效果出色。NotebookLM可拆解复杂信息,Gemini以其为参考数据源答案更精准。二者还能基于笔记本做网站、视频、图片等,各有优势、双向协作。

AI进修生
算法论文8

上下文工程(Context Engineering)综述:大模型的下一个前沿

文章提出“上下文工程”学科,通过整合1400余篇论文构建“基础组件 - 系统实现”框架。它将上下文定义为动态结构化信息集合,揭示LLMs理解强于生成的矛盾,为AI研究指明方向。

深度学习自然语言处理
算法论文8

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。

机器之心
推荐文章8

上交博士最新思考:仅用两个问题讲清强化学习

上交博士 Kun Lei 博客提出用两个问题理解强化学习:数据从哪来、策略更新多频繁。借此梳理算法逻辑,还延伸到机器人基础模型,指出训练节奏与其实践契合。

AI科技评论
推荐文章7

Karpathy公开附议:AI Agent 的输出格式,正在从 Markdown 走向 HTML

随着 Agent 处理任务变复杂,Markdown 在文档中可读性与排版局限凸显。HTML 能无损表达信息、支持双向交互,但生成耗时久、版本控制难。AI 研究者 Karpathy 附议,HTML 成探索方向。

深度学习自然语言处理