「多模态社区」共找到 1332 篇相关文章
手握30亿、被蚂蚁狂挖人,转型被骂惨的王小川,真的翻身了?
在大模型竞争中,2023 年成立的百川战略收缩聚焦医疗,起初内外存疑。2025 年,AI 医疗技术与应用进展显著,今年初大厂入局。百川如今开源 Baichuan - M3 模型,王小川认为医疗已入应用阶段、多模态非主战场,且国内 To C 更好。
在 Sora 诞生之前,胡修涵做了两年多的「二次元版 Sora」
Sora发布后迅速获数百万用户,全球刷屏。国内创业公司捏Ta在其诞生前两年就开始做类似产品,专注二次元和OC人群。捏Ta创始人胡修涵分享对Sora的看法,认为它是新形态产品,还在探索需求。同时谈及捏Ta发展阶段、特色功能及社区运营理念等。
下一站AI创业主线:别卷模型了,把这件事干成才重要
在AGI Playground 2025上,极客公园张鹏与三位投资人探讨Agent时代投资。他们认为AI创业进入「拼交付」时代,多模态短期影响被高估、长期潜力被低估,通用Agent是巨头之争,垂直Agent是创业机会,还会催生新基础设施,付费模式向按结果付费演变。
王智、沈今晶、方汉、郑林等等都来了,AIFUT大会Day2上午场全记录。
AIFUT大会第二天上午场精彩纷呈。AJ谈900万人共建AI社区历程;王智、沈今晶探讨AI与电影创作;方汉称一人公司时代到来,分析难被替代的五种人;郑林谈影视成本与未来趋势;李勇提出AI玩具应是朋友。
一个Dispatch Dtype引起的fp8 quant kernel性能问题
文章记录SGLang社区在sgl-kernel中解决的fp8 quant kernel性能问题,因错误使用`c10::Float8_e4m3fn`数据类型,未用硬件加速指令,通过软件调用致性能下降,现已修复,vLLM也应用此修复。
Claude时代终结?LMArena实测DeepSeek R1编程得分超Opus 4,但月暗称其新模型更胜一筹
在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分超Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩超R1。
2025,大模型文档解析(OCR)年终盘点
2025年6月以来文档解析方法快速增长,有10余种。按“技术路线 + 工程形态”可归为4大类:传统级联流水线、轻量多模态两段式、通用多模态大模型一段式、轻量多模态一段式,各有优劣,4条路线覆盖所有OCR落地场景。
原生Agent杀入画布!一站式搞定专业创作,全程可控、不抽卡
国内RunningHub平台推出原生AI智能体全能内容创作平台RHTV,它能一站式搞定专业创作,流程可控。实测显示,它能编排短剧、生成商用物料,还内置影视级工具,且依托庞大生态,能力无上限。
谷歌Nano Banana全网刷屏,起底背后团队
谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。
1/8成本比肩Claude 3.7,Mistral Medium 3来了
“欧洲OpenAI”Mistral AI发布多模态新模型Mistral Medium 3,主打编程和多模态理解,成本仅Claude 3.7的1/8,性能达其90%,API已上线,还推出企业聊天机器人服务,引发网友不同看法。