DeepSeek V4」共找到 2237 篇相关文章

开源动态8

超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光

英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全部开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。

新智元
7

刚刚DeepSeek宣布大规模扩张,整体至少扩员一倍,全体岗位集体喊人加入

DeepSeek宣布大规模扩张,各部门规模至少扩一倍。其发力点包括底层算力与系统优化、高质量数据、Agent与应用落地及探索Next Level科研。用人反内卷、反官僚,岗位接受实习,还新增AGI核心业务管培生。

AI寒武纪
开源动态7

国产开源大模型:再见9月,你好10月~

9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。

PaperAgent
新闻资讯7

等了十年,特斯拉Robotaxi终于上线!马斯克:仅需4.2美元一口价

上周日,特斯拉在德克萨斯州奥斯汀启动Robotaxi服务,首批乘客4.2美元一口价。服务限定试运营,覆盖区域受限,车内有安全监控员。目前体验平稳但不成熟,未来能否后发先至待验证。

机器之心
新闻资讯7

养虾人狂吃国产模型!4.19万亿Token调用量激增34.9%超越美国

根据OpenRouter数据,上周中国大模型周调用总量飙升至4.19万亿Token,再度超越美国登顶全球。中国产品在全球大模型调用量Top 5中占三席,国产大模型受青睐,但在速度和价格方面仍待提升。

量子位
开源动态8

IBM推出轻量多模态文档神器!OCR与QA超GPT-4o,识别率高达98%!

日常文档处理麻烦,现有工具或体积大、算力消耗高,或识别精度不够。IBM 开源轻量多模态文档处理模型 Granite - Docling,仅258M参数,性能超 GPT - 4o,适用于多场景。

开源星探
产品应用7

刚刚,OpenAI开放GPT-4.1偏好优化DPO,ChatGPT能真正学会你的「品味」了!

OpenAI宣布GPT - 4.1全系列模型支持DPO微调,可让AI通过对比回答学会用户偏好。介绍了DPO原理、适用模型、数据格式、创建任务方法等,还提及开发者反应与技术要点。

AGI Hunt
产品应用7

老黄亲自站台,英伟达编程神器!Cursor 2.0自研模型狂飙4

Cursor 2.0版本重大升级,发布自研编码模型Composer,速度是同等模型4倍。还重构IDE交互逻辑,支持多智能体模式,引入语音模式等。早期测试和开发者反馈其速度快,但智能程度与部分模型有差距。

新智元
开源动态8

Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型

Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。

AGI Hunt
算法论文8

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。

机器之心