「Gemini 3.2 Flash」共找到 3703 篇相关文章
刚刚,DeepSeek官宣V3.1发布,Agent 能力较大提升
DeepSeek官宣V3.1发布,核心特性有混合推理架构、思考效率提升、Agent能力增强。产品形态含官方App/网页端和API升级。性能在编程、搜索智能体及思考效率上显著提升。
以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能
dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。
刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」
年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。
GPT Image 2研究科学家陈博远:我在OpenAI修中文
GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。
全网实测Gemini Omni!一句话改视频,草图变大片
谷歌在Google I/O大会推出Gemini Omni,它结合推理与生成能力,在多方面有重大飞跃,能生成逼真视频等。它打破命名体系,训练目标不同,有涌现能力,谷歌还为其设置限制。
阿里又上好货了!Qwen3-TTS能力大幅提升
阿里刚发布Qwen3-TTS(2025-11-27版),解决语音合成核心问题。它音色大幅扩展,有49种高品质音色;语言和方言能力提升,支持10种主流语言与多种方言;韵律和语速优化,拟人化近真人;API调用简单。
苹果AI自研不动,库克外包给谷歌Gemini了
今天凌晨,苹果与谷歌官宣达成深度合作协议,基于Gemini模型和谷歌云技术构建下一代苹果基础模型,成果之一是今年内上线“更个性化的Siri”。此前苹果自研AI推进不顺,人才流失严重。
DeepSeek 官宣V3.1:迈向 Agent 时代的第一步!
DeepSeek 官宣发布 V3.1,称这是迈向 Agent 时代第一步。其有混合推理模式,Agent 能力全面进化,API 也全面升级,支持 Anthropic API 格式。还继续开源,9 月 5 日起调整价格,社区反响热烈。
3D多光照场景渲染!GRGS带来真实感重光照
哈工大提出通用3D高斯框架GRGS,用于多样光照下高保真人体新视角合成。它采用前馈监督策略,支持可编辑光照,结合物理着色与神经网络推断,合成逼真效果,但处理透明材质和纤薄结构欠佳。
狂涨 10.3k star!共享虚拟浏览器,太酷了!
今天分享项目`Neko`,是基于Docker的虚拟浏览器,用WebRTC技术服务。能在安全隔离环境上网、浏览、运行程序,适合和人共享页面,可一起观影、购物、协同工作,目前在Github获10.3K star。