DeepSeek 671B」共找到 1377 篇相关文章

8

阿联酋K2横空出世,数学、代码样样行,速度全球最快,GPT-4看了都得抖三抖

阿联酋穆罕默德·本·扎耶德人工智能大学与G42公司联合推出开源AI推理系统K2 Think,基于Qwen 2.5 - 32B模型。它靠六项技术性能出众,在多领域测试成绩好,还以小参数量媲美大模型,且全面开源。

AIGC开放社区
开源动态7

Qwen3小升级即SOTA,开源大模型王座快变中国内部赛了

开源大模型进入中国时间,Kimi K2风头正盛时,Qwen3迎来升级,235B总参数量仅为Kimi K2四分之一,基准测试性能却超它。Qwen官方不再用混合思维模式,新模型仅支持非思考模式,此次是小更新,大招在后头。

量子位
新闻资讯7

GPT之父:只用上世纪数据训AI,它居然也会写Python?!

GPT之父Alec Radford团队训练出talkie - 1930 - 13b模型,其训练数据截止1931年。该模型能说新政立法、写Python代码。团队还对比其与现代模型,发现核心能力差距不大,且用老语料调教它成聊天助手时现风格问题。

量子位
新闻资讯7

18岁天才少年,登上Nature封面!

DeepSeek-R1荣登Nature封面,成史上首个经严格同行评议大模型。18岁天才少年涂津豪以实习生身份参与,其从高中生到Nature作者的经历堪称传奇。他还改造Claude 3.5,开源项目获15k多星,还对AGI发表思考。

新智元
开源动态8

10项评测痛打GPT-4o!智源重磅开源全球最强具身智能大脑

近日,智源研究院开源具身大脑RoboBrain 2.0 32B版本和跨本体大小脑协同框架RoboOS 2.0单机版。RoboBrain 2.0在多项权威具身智能基准上刷新纪录,RoboOS 2.0创新性集成MCP协议与无服务器架构,二者双擎联动推动机器人迈向群体智能。

新智元
新闻资讯7

利润腰斩也要卷AI!小米模型永久降价99%,雷军还要再砸600亿

今日小米宣布 MiMo-V2.5 系列 API 永久降价,最高降 99%,Token 额度提升。虽 2026 年 Q1 财报显示利润腰斩、营收下滑,雷军仍称今年 AI 投 160 亿,未来三年投 600 亿。此前 DeepSeek 也已降价,中国大模型在 OpenRouter 表现亮眼。

AI前线
算法论文8

Claude团队用Qwen测试全新训练方法

Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。

量子位
产品应用8

不敢信?中国AI国家队出手,刚刚通关了万亿级主战场「地狱副本」

文章指出智能体虽强,但在招标采购等落地场景面临挑战。科大讯飞发布招采智能体平台,提出智能体工厂概念,解决招采痛点。还提炼出四个行业判断,分析其成功原因,标志AI在B端场景走向落地。

新智元
产品应用8

AI Code要变天了,Meta首个代码世界模型登场!

Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。

PaperAgent
产品应用7

Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍

Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。

机器之心