「Gemini 3.1 Pro」共找到 3827 篇相关文章
阿里刚投的AI明星,3D大模型那种
通用人工智能公司VAST宣布完成5000万美元A轮融资,由阿里、恒旭资本联合领投。其自研3D基础大模型领先,发布全新AI 3D大模型家族。2025年重点研发世界模型,2026年将加速建设UGC互动内容平台。
刚刚,百度最新开源神作:PaddleOCR-VL-1.5上线了
1月29日百度开源新一代文档解析模型PaddleOCR-VL-1.5,参数仅0.9B,在OmniDocBench V1.5评测中综合性能全球第一,精度达94.5%。它支持异形框定位,解决真实文档解析难题,在多场景表现出色。
Qwen3-LiveTranslate:视、听、说全模态同传大模型!
Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。
刚刚,李飞飞世界模型开源了个渲染神器
今天凌晨,李飞飞空间智能独角兽公司 World Labs 官宣推出「Spark 2.0」,将 3DGS 世界带入 Web,原本专业设备才能运行的 3D 场景,现在任何人可在浏览器访问,该渲染器开源,能流式加载 1 亿 + 的 3DGS 数据。
谷歌开源的 Gemini CLI 扩展助力开发者构建定制化人工智能工作流
谷歌发布开源的 Gemini CLI 扩展框架,引入‘剧本’概念,可让 AI 与外部工具交互。框架增强了 Gemini CLI 功能,支持多组件。谷歌构建开放生态,还为开发者提供模板和指南,其在 AI 驱动 CLI 领域有独特优势。
刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 5
刚刚,DeepSeek V4 Pro正式版发布,多项对标Fable 5,Agent能力几乎全方位碾压Opus 4.8,无限逼近Fable 5。API平台已更新,价格和之前Pro预览版基本一致,但网友实测发现CoT表现不佳。
3.2K star!!高中生开发,媲美IDM,这款开源下载神器厉害了!
最近发现一款开源项目Ghost - Downloader - 3,由高中生独立开发,支持三平台,用Python编写且运行快,还融入AI技术自动调教下载策略。已有3.2K star,功能强大,安装和使用都简单。
社区供稿丨Ring-2.5-1T,思更深,行更远
今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、长程执行上大幅提升。与其他模型对比,在高难推理和长程任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。
SGLang Custom AllReduce v1 与 v2 实现原理详解
文章聚焦 SGLang 里两代自定义 all-reduce 实现(v1 和 v2),前者从 vLLM 移植,后者是默认版本。详述其负载特征、前提条件、分发链、同步机制、算法及 CUDA graph 支持等内容,还对比了两代差异,并提及相关环境变量。
Google刚刚开源的一款AI工具,Gemini 2.5驱动浏览器自动化!
Google在GitHub开源AI浏览器自动化工具Computer Use Preview,基于Gemini 2.5模型,用自然语言控制浏览器完成复杂任务。支持双环境,集成Gemini API/Vertex AI,适用于Web测试等,零代码入门。