「SD3.5-Flash」共找到 3501 篇相关文章
高效大规模创新3D重建模型iLRM
多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。
刚刚,Sam Altman宣布:GPT-5即将发布
Sam Altman在X上宣布OpenAI通用推理系统在2025年IMO达金牌水平,同时透露GPT - 5即将发布。OpenAI研究员Alexander Wei介绍突破细节,模型解决多道题获35分。GPT - 5是实验模型,有金牌能力的版本还需等待。
千问3:开源第一不只是说说!
英伟达新开源的OpenCodeReasoning系列选千问作基础底座。千问3以Apache 2.0发布后,开发者生态更新频繁,衍生模型超10万,下载量破3亿,全球第一。其性能强,正加速开启全栈式AI时代。
PDL 在 SGLang Kimi K3 中的应用
文章介绍 PDL 在 SGLang Kimi K3 中的应用,K3 内核优化接入 PDL 以缩短相邻内核间隙。分析 PDL 原理、在 bs=1 decode 中解决的问题,阐述计算链和通信链上的应用,还提及性能数据和实现问题。
杨植麟预告,Kimi K3要来了
月之暗面团队海外AMA透露Kimi K3相关信息。K3或采用KDA架构,有低成本优势;通过开源解决信任问题;将推出不同规格模型;产品打磨注重写作、视觉能力及NSFW内容探索。Kimi性价比模式或改写行业规则。
OpenAI o3-pro模型发布,但不能聊天
当地时间6月10日,OpenAI o3 - pro模型发布,ChatGPT Pro用户可通过API使用。它是o3子版本,在多领域表现出色,但响应慢,适用于对可靠性要求高的难题。目前临时聊天功能停用,不支持图像生成和Canvas。
Qwen3新成员:Embedding系列模型登场!
今天正式发布Qwen3-Embedding系列模型,专为文本表征等任务设计,继承Qwen3多语言理解优势。在多项基准测试表现卓越,已在多平台开源,有卓越泛化性、灵活架构与多语言支持等特点。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
全新OCR将图片变代码无损重绘!华中科大&小红书发布3B模型,图形重建超越Gemini 3 Pro
华中科技大学与小红书联合推出MOCR,提出「解析一切」新范式,将文档图形升级为「一等解析目标」。它解决传统OCR短板,在文档解析和图形重建表现出色,还革新评估方法,代码和模型已开源。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。