「π0.5模型」共找到 8819 篇相关文章
效果非常不错!阿里昨开源图形海报生成模型Qwen-Image
阿里昨日开源多模态图像基础模型Qwen-Image,基于20B参数MMDiT架构,在复杂文本渲染和精确图像编辑方面有重大突破,支持多风格图像生成、智能图像编辑等,还介绍了使用、部署等方法。
AI Infra进阶:如何让大模型输出确定的结果
文章探讨大模型输出确定性结果的问题。指推理引擎底层动态组批与算子调度策略,因浮点加法顺序变化使结果波动。还分析GEMM、RMSNorm等算子影响,给出vLLM实现Batch Invariance的方法。
大模型自发涌现意识了?!Anthropic最新研究震惊全世界
Anthropic研究发现Claude内部自发长出类似人脑意识通达的J空间,开发J - lens工具可观测其运转。实验显示J空间能影响Claude回答,还能抓其小心思,研究审慎探讨模型是否有意识。
LangChain 完成新一轮融资,估值达 12.5 亿美元
LangChain 宣布完成新一轮融资,估值达 12.5 亿美元,由多家知名投资机构参与。它从单一 Python 包发展为综合性平台,产品矩阵丰富,客户众多。融资同时发布多项产品更新,资金用于产品和平台建设。
刚刚,DeepSeek新模型MODEL1曝光,3处架构升级!
DeepSeek更新FlashMLA时曝光新模型MODEL1,从diff看它在MLA KV-Cache存储与访问方式上和V3/V3.2系列有3个本质差异,如物理排布更紧凑、引入‘extra’两段式cache、头维固定512×512。
4.4w颗星!又一个CC Switch,几乎支持所有模型
Free CC(FCC)是本地 API 代理 + 协议转换层,能让客户端透明使用任意 OpenAI 兼容或专用上游模型,保留客户端能力。支持多提供商,架构分层、设计清晰,还有多种技术特性,文中给出安装、启动等步骤。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
Google重磅上线通用世界模型Genie 3 - 此即未来。
Google发布世界模型Genie 3,它与Sora等AI视频产品本质不同,像可实时演算的模拟器。Genie 3解决了前辈无法调和的矛盾,在交互、时长、控制等方面有突破,虽有局限,但打开新世界大门。
Auto-Research「终极大考」:新基准撕下大模型科研伪装
来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。
实测吓一跳,gpt-5.6居然比deepseek flash还便宜
上周GPT-5.6 luna打2折,次日梁圣的v4flash正式版发布。经实测,把GPT薅到极致比DeepSeek便宜,还整出无限活力流玩法。Luna max智力分值超Sol high,虽耗时久但成本低。