多模态视频生成」共找到 3298 篇相关文章

开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
开源动态8

字节开源了一个让人上头的 Context 项目

字节开源 MineContext 项目,是其“三步走”开源策略首步。它能自动收集屏幕上下文、生成日报待办等,还可深度分析。其理念为主动洞察、无负担收集,未来 OpenContext 开源后开发者可搭建应用。

特工宇宙
7

The Batch: 886 | OpenAI 与 Meta 多元化其 AI 产品线

OpenAI和Meta此前专注聊天机器人,如今分别推出新举措。OpenAI推Sora 2、ChatGPT Pulse和Instant Checkout;Meta推出Vibes。新项目利用AI提升用户参与度与收入,探索社交视频领域和大模型与商务融合。

DeeplearningAI
新闻资讯8

从Transformer到GPT-5,听听OpenAI科学家 Lukasz 的“大模型第一性思考”

2017年《Attention Is All You Need》提出Transformer架构,重塑AI版图。其作者“Transformer八子”中,Lukasz Kaiser加入OpenAI,参与GPT-4、GPT-5等研发。他10月将出席大会分享见解,曾预言多模态等趋势已渐成现实。

AI科技大本营
新闻资讯8

国产大模型「五强争霸」,决战AGI!

中国基础大模型市场形成「基模五强」格局,包括字节、阿里、阶跃星辰、智谱和DeepSeek。它们要么有钱,要么有人,各有特色与优势。未来竞争焦点是追求更高「智能上限」和突破「多模态能力」,决战AGI。

新智元
新闻资讯7

马斯克都惊呼太强!阿里Qwen3.5又一波端侧小模型发布

上周阿里发布Qwen3.5中等规模超强模型,现又推出端侧小模型,获马斯克称赞。其智能密度翻倍且原生多模态,各型号有Base版。不同参数模型性能出色,阿里布局完整生态链,开启智能化未来。

AIGC开放社区
产品应用7

AI 创作继续:Google 推出Pomelli,一款能读懂你网站气质的 AI 营销设计师

Google Labs推出AI营销工具Pomelli,可帮中小企业几分钟内创建符合品牌的社交媒体活动。流程为给其网站,它建立品牌“商业DNA”,生成活动创意和资产,用户编辑调整即可。输出仅支持英文,出海网站可尝试。

AI进修生
新闻资讯7

Vibe Coder 之死

文章围绕Vibe Coder之死展开,讲述机器人因Vibe Coding失控视频走红,引发对机器人安全热议,探讨其危害、发生可能性、防范措施等,指出当前AI发展枉顾安全,还提及人们对AI+机器人未来的多种看法。

AGI Hunt
开源动态8

微软开源了一款 skill 神器,这下爽了!

近期微软开源桌面应用 `Skill Recorder`,1个多月揽3K star。它能录屏幕操作,借助 GitHub Copilot CLI 生成可复用 Skill 或 Automation,与 RPA 思路不同,有泛化能力,可按命令快速安装。

开源先锋
算法论文8

80万条数据揭示隐患:AI正在「污染」病历,你的诊疗数据可能越来越不靠谱

新加坡国立大学等机构团队研究显示,AI生成临床文本用于训练新模型,会使病理信息在数据迭代中消失,降低医疗AI诊断可靠性。研究分析80多万条合成数据,还提出缓解方法。

机器之心