DeepSeek V4 Pro」共找到 1342 篇相关文章

开源动态8

500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式

香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。

量子位
推荐文章7

TPU vs GPU 全面技术对比:谁拥有 AI 算力最优解?

SemiAnalysis对Google TPU v7/v8深度拆解,将TPU与Nvidia GPU多方面对比拆到可计算层面。不过其结论有局限性,本文重新分析,指出TCO因场景而异,互联体系分歧在流量假设,Google TPU v8成本优势被削弱。

海外独角兽
开源动态8

Sand.ai重磅更新MagiAttention,正在定义分布式Attention性能新标杆

2025年4月,Sand.ai开源MagiAttention v1.0.0。如今发布v1.1.0,适配Blackwell新架构,构建原生Group Collective原语,经系统级协同优化,在多模型训练中得到实证,展现卓越性能。

机器之心
新闻资讯7

Meta首席科学家LeCun:当前 AI 模型缺乏四项关键人类智能特质

在巴黎AI行动峰会上,Meta首席AI科学家Yann LeCun提出智能四项标准,指当前主流AI系统尤其语言模型在这些方面不足。他认为业界‘组合式’增强是‘功能修补’,介绍Meta‘世界模型’及V-JEPA模型。

力学与人工智能
新闻资讯7

大模型全员0分!谢赛宁领衔华人团队,最新编程竞赛基准出炉,题目每日更新禁止刷题

谢赛宁等人出题,让o3、Gemini - 2.5 - pro等模型全军覆没。LiveCodeBench Pro是实时基准测试,题库每日更新。此前称LLM编程超人类专家,本次测试并非如此,最好模型难题通过率也为0。

量子位
推荐文章7

21

本文聚焦vllm v1中管控模型分布式推理的核心Executor部分,介绍其4种类型及适用场景,以mp类型为例阐述Executor - Workers架构,还说明了大小数据在两者间的传输机制及原理。

猛猿
产品应用7

人类遗忘的难题解法,被GPT-5重新找出来了

GPT-5 Pro从埃尔德什问题定位到关键文献,发现该“未解决”数学难题早在2003年已被解决。此前网友曾热烈讨论此问题,此外,有教授称GPT-5 Pro能快速发现论文漏洞。

量子位
新闻资讯8

GPT-5.4 vs Opus 4.6 vs Gemini 3.1:五条结论

2026年3月前沿AI竞争激烈,GPT - 5.4、Opus 4.6、Gemini 3.1 Pro各有千秋。GPT - 5.4领先知识和计算机使用,Gemini 3.1 Pro以低价主导推理,Opus 4.6编程能力强,无单一模型通吃各领域。

PaperAgent
产品应用8

AI重塑搜索:夸克“深度搜索”如何定义下一代信息入口|甲子光年

大模型发展推动搜索产品革新,“搜索”变“深度搜索”。夸克升级AI超级框发布“深度搜索”,即将推出“深度搜索Pro”。其“深度搜索”情商高,“深度搜索Pro”免费、快速、专业,夸克正打造AI全能助手。

甲子光年
产品应用8

GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。

AI寒武纪