长视频理解」共找到 2145 篇相关文章

开源动态8

18K+标星!视觉AI驱动的浏览器自动化,告别XPath,无惧网页改版!

网页自动化常遇页面更新脚本报废等难题,而开源工具Skyvern不走传统XPath/DOM路子,用视觉+大语言模型理解网页,能自适应改版,功能丰富,安装运行简单。

开源星探
算法论文8

Anthropic:上下文工程在AI Agents的正确打开方式!

在‘提示工程’后,‘上下文工程’成焦点。它是提示工程延伸,因信息过多模型会‘失焦’,上下文是稀缺资源。文章介绍高效上下文‘解剖学’、运行时检索策略、周期任务应对方法等。

PaperAgent
推荐文章7

AI让文科彻底灭绝?算法猜不透人心,人类终将反杀!

著名科技记者Steven Levy给文科生打强心剂,认为无论AI多强大,它没人性,人文学科涉及对人类行为与创造力的理解,是计算机无法获得的,文科生仍有广阔未来。

新智元
开源动态8

开源一个拯救你旅行废片的 Skill

作者因旅行照片不尽人意,开发开源 Skill Yingzao · 营造。它风格多样、能检索文化背景,可进行原图对比拼图、多图融合等,适用场景广,还能生成视频,工作方式独特。

歸藏的AI工具箱
新闻资讯8

生数科技按下B端商业化快进键:30天签约智谱、飞书等多家行业龙头|甲子光年

AI视频生成行业商业化加速,生数科技不到一周官宣与智谱、飞书等合作。其Vidu基座模型能力强,多领域开花,2025年Q1商业化增速快,还凭交付与服务能力获头部青睐。

甲子光年
算法论文7

大模型也需要睡觉!让AI打个盹,醒来更聪明

卡内基梅隆大学和马里兰大学研究发现,大模型处理上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。

量子位
开源动态7

跨平台智能媒体处理与创作工具箱

pyMediaTools 是基于 PySide6 的跨平台桌面应用,集成媒体批处理和 AI 音视频创作工具。利用 FFmpeg、ElevenLabs 和 Groq API,有格式转换、语音合成等功能,还介绍了安装、配置、打包方法。

GitHubStore
开源动态8

3行代码做出自己的数字人,GitHub爆火的国产项目你用上了吗?

中国硅基智能推出HeyGem与DUIX两大开源项目,在GitHub引发热潮。HeyGem能快速克隆数字分身、生成4K视频,DUIX支持实时交互,二者构建完整技术闭环,推动数字人技术普及。

开源星探
新闻资讯7

华纳兄弟起诉Midjourney

Theverge消息,华纳兄弟起诉文生图平台Midjourney,称其AI工具生成大量侵犯版权的角色图像和视频,如蝙蝠侠、超人等。诉状列举侵权行为,提供对比案例,华纳希望获禁令并索赔。

AIGC开放社区
新闻资讯8

OpenAI Codex负责人 Tibo访谈:指明未来Agent方向以及为什么频繁重置额度

近期OpenAI Codex负责人Tibo接受采访,透露产品方向与技术路线,如让Agent深度理解用户、合并ChatGPT和Codex等,还谈及保持迭代、对竞争态度、重置用量限额等问题。

AI工程化