「多模态生成与理解统一」共找到 3428 篇相关文章
Meshy用户破千万后杀向新战场:ARR年翻14倍,头部厂商集体买单
Meshy是计算机图形学大神胡渊鸣创立的AI 3D公司,其创意工坊打通“AI创意→实体交付”。Meshy生成模型打印适配度高,破圈至多元领域,注册用户破千万,ARR年翻14倍,获多轮融资。
比OpenClaw还狠!奥特曼押注「心灵感应」,Codex直接读取你的屏幕
4月21日,OpenAI上线Chronicle研究预览版,它能读取屏幕内容形成记忆图谱,帮Codex理解上下文。虽解决AI失忆短板,但吃Token且有隐私风险,这是其在用户记忆战争的首枪。
从 SQL 到自然语言,下一代 Lakehouse 为何必须「AI 优先」
随着大模型技术爆发,数据分析范式重构,未来数据多模态、分析复杂、查询方式转变。文章指出构建下一代 AI-First Lakehouse,要在存储计算、内核能力、架构适配、平台自治等方面升级,打破数据壁垒。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
让大模型合成检查器:UIUC团队挖出Linux内核90余个长期潜伏漏洞
伊利诺伊大学香槟分校张令明老师团队的论文提出KNighter,它让大模型生成静态分析检查器,在Linux内核挖出92个长期潜伏漏洞,将LLM归纳能力沉淀为规则,带来可落地等好处。
国产开源LLM迎来大爆发的一周:Kimi、腾讯、快手、美团、面壁智能
国产开源大模型迎来爆发,快手、月之暗面、美团、面壁智能、腾讯等接连发布新模型,如快手Keye-VL - 1.5 - 8B刷新视频理解SOTA,美团LongCat - Flash - Chat推理快成本低等。
从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态
本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。
等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……
MiniMax新发布的视频模型H3在多模态能力出色,霸榜Artificial Analysis榜单。但开源模型有部署和成本难题,秘塔AI上线该模型,免部署,2K方案0.15元/秒,768P方案0.09元/秒,降低创作门槛。
手撕Sora,脚踢Veo!13个行业实战案例,Seedance 2.0玩法大全
本文是藏师傅对 Seedance 2.0 的测评和教学,介绍其 API 春节后将上线火山引擎,支持全模态输入。通过 13 个行业实战案例展示该模型能力,如生成广告、宣传片、教学视频等,还提及 Agent 自动化应用。
Claude写完代码不直接交了:4个Skill自查一遍,改好再找你
Anthropic将AI验收纳入循环,让Claude写完代码后进行四道检查才交付,定义了验证循环,Claude Code团队有4个自查Skill,还介绍了写验证Skill的方法、触发设置,AI编程竞争正从生成转向验证。