「大模型V4」共找到 9301 篇相关文章
Qwen团队发布长上下文Reasoning模型QwenLong-L1,超越o3-mini
Qwen团队发布长上下文Reasoning模型QwenLong - L1。当前大模型处理长文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。
解析科大讯飞:把AI做成懂你的那一个|甲子光年
2025年中美AI发展路径分化,中国企业探索本土商业化道路。科大讯飞董事长刘庆峰提出自主可控、软硬一体、行业纵深、个性化四个关键词。其用华为昇腾芯片训练出可商用大模型,在多领域展现优势,还发布新功能和产品,为AI商业化提供“中国答案”。
云栖大会阿里掀桌子了!Qwen3-Max、VL、Omini、Agent ... 统统发布!
云栖大会上,阿里云智能首席技术官介绍千问多款新模型发布及一款升级。如万亿参数的Qwen3 - Max,代码和Agent能力强;还有Qwen3 - Coder - Plus、Qwen3 - VL、Qwen3 - Omni、Qwen3 - LiveTranslate等模型各有亮点。
首个代码世界模型引爆AI圈,能让智能体学会「真推理」,Meta开源
Meta重组后的AI部门推出首个代码世界模型CWM,是320亿参数开放权重LLM。它与传统大模型思路不同,能模拟代码执行。CWM在通用编程与数学任务表现不错,Meta还开放相关检查点以支持研究。
超脑未来WorldDreamer V4横扫多个权威榜单,世界模型进入群体智能时代
超脑未来发布 WorldDreamer V4,它以多智能体为基本单位,具多种核心能力。采用新预训练架构,引入 Masked Agent Modeling,用共享隐式世界状态带来新协同范式,还在多权威榜单领先。
DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了
过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类多智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。
DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!
DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。
DeepSeek-V4发布!高效百万上下文智能普惠时代来了
DeepSeek-V4发布,是开源社区关键分水岭。它解决超长文本处理效率痛点,架构与优化有多项突破,降低算力消耗和成本,适配国产芯片,性能比肩顶级闭源模型,推动开源社区两大未来趋势。
落地商用开启国产一体化智算新时代,蓝芯算力LX500亮相滴水湖RISC-V产业论坛
2026年8月13日,第五届滴水湖中国RISC - V产业论坛召开。蓝芯算力生态营销负责人许庆伟以核心产品LX500为线索,从架构、算力、商业落地三方面,展示国产RISC - V算力商用路径。
刚刚,全球最难考试惊天大反转!黑马AI冲破36%,顶流模型集体翻车
ARC-AGI-3测试中,顶级大模型Opus 4.6仅得0.2%,人类获满分。而Symbolica公司用Agentica框架首日就取得36.08%的成绩。该框架有独特技术路径和策略,但成绩未经验证,ARC-AGI-3被视为通向AGI的‘北极星’。