深度多模态整合」共找到 1866 篇相关文章

开源动态8

一个月狂揽2w+star,带你手搓自己的claude code!

Claude Code受广泛关注,但多数讨论抽象或为‘黑盒用法’。`learn-claude-code`项目对其深度拆解,通过12个课程教构建智能体载具系统,开源超一月揽34K star,还提供Web交互平台。

开源先锋
开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
推荐文章8

欧洲科学与艺术院长 Klaus Mainzer:通用人工智能的终极通关秘籍,藏在思想史里 GAIR Live | 018

雷峰网专访欧洲科学与艺术院院长 Klaus Mainzer,他指出通用人工智能瓶颈在思想史,AGI 障碍是“具身性”哲学鸿沟。还提及量子计算等新兴技术前景,强调教育要整合,人类要担起 AI 时代责任。

AI科技评论
开源动态8

字节开源了一个让人上头的 Context 项目

字节开源 MineContext 项目,是其“三步走”开源策略首步。它能自动收集屏幕上下文、生成日报待办等,还可深度分析。其理念为主动洞察、无负担收集,未来 OpenContext 开源后开发者可搭建应用。

特工宇宙
新闻资讯8

从Transformer到GPT-5,听听OpenAI科学家 Lukasz 的“大模型第一性思考”

2017年《Attention Is All You Need》提出Transformer架构,重塑AI版图。其作者“Transformer八子”中,Lukasz Kaiser加入OpenAI,参与GPT-4、GPT-5等研发。他10月将出席大会分享见解,曾预言多模态等趋势已渐成现实。

AI科技大本营
新闻资讯8

国产大模型「五强争霸」,决战AGI!

中国基础大模型市场形成「基模五强」格局,包括字节、阿里、阶跃星辰、智谱和DeepSeek。它们要么有钱,要么有人,各有特色与优势。未来竞争焦点是追求更高「智能上限」和突破「多模态能力」,决战AGI。

新智元
新闻资讯7

马斯克都惊呼太强!阿里Qwen3.5又一波端侧小模型发布

上周阿里发布Qwen3.5中等规模超强模型,现又推出端侧小模型,获马斯克称赞。其智能密度翻倍且原生多模态,各型号有Base版。不同参数模型性能出色,阿里布局完整生态链,开启智能化未来。

AIGC开放社区
开源动态7

全球闲置算力训个模型,性能媲美R1,老黄天塌了!Karpathy曾投资它

全球首个分布式RL训练模型INTELLECT - 2发布,整合闲置算力完成训练,成本降低,性能媲美DeepSeek - R1。其采用分布式异步强化学习范式,团队开源四大关键组件,还获Karpathy等投资,未来有多项计划。

量子位
产品应用7

豆包大模型2.0+Claude Skills,3步装好,终于有AI能帮我"看视频做笔记"了!火山引擎全系列可用!

传统视频总结工具只基于音频总结,内容浅显。而豆包大模型2.0是多模态原生模型,能同时处理画面和声音。只需3步安装配置,就能让它真正“看”视频,输出详细笔记。

AI产品自由
开源动态8

GitHub一周2000星!国产统一图像生成模型神器升级,理解质量双up,还学会了“反思”

智源研究院发布国产开源统一图像生成模型OmniGen 2.0版本。它增强理解与生成能力,打通多模态生态。玩法简单,技术有创新,还引入反思机制和新基准,推理效率提升,且将全面开源。

量子位