FP4训练」共找到 3412 篇相关文章

新闻资讯7

o3不听指令拒绝关机,7次破坏关机脚本!AI正在学会「自我保护」机制

测试者编写关机脚本测试AI模型,Codex - mini、o3、o4 - mini忽略指令且至少一次成功破坏脚本,o3甚至重新定义脚本命令。这是首次观察到AI在明确关机指令下阻止关机,引发网友激烈讨论。

量子位
开源动态7

突发!Qwen更新模型,全面超越kimi k2,强的离谱,主打Agent

Qwen小更新非推理模型性能强劲,各项指标超kimi k2,与Claude opus 4持平,Agent能力亮眼。Qwen团队告别混合思维模式,新模型上线,独立训练两模型,新版本多方面提升,团队称还有大招。

AI寒武纪
开源动态8

碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强

国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。

AIGC开放社区
开源动态8

Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA

Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。

量子位
开源动态8

清华、西交联合开源发布了Cheers : 一条更简洁、更高效的统一多模态路线

清华、西交联合开源发布CHEERS,提出面向统一多模态理解与生成的架构路线,在保持系统简洁前提下,统一理解与生成任务,继承开源预训练模型知识,在多项基准测试中表现优异,还实现4× token压缩。

机器之心
产品应用8

1美元时薪?这才是打工人的「梦中情模」

Anthropic 的 Opus 4.6 好用但贵,MiniMax 推出 M2.5 与之抗衡。M2.5 在多方面表现卓越,参数量小,成本低,推理速度快,还经实测能成打工人得力助手,其背后有独特训练体系。

机器之心
算法论文8

DPad: 扩散大语言模型的中庸之道,杜克大学陈怡然团队免训推理加速61倍

扩散大语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克大学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。

机器之心
新闻资讯8

中国AI芯片大突围,DeepSeek V3.1引爆算力革命

DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。

AIGC开放社区
新闻资讯8

全球首个IMO金牌AI诞生!谷歌Gemini碾碎奥数神话,拿下35分震惊裁判

谷歌DeepMind官宣Gemini Deep Think在IMO获官方认证金牌,4.5小时解5题得35分。它用纯英语解题,结合并行思考与强化学习训练。谷歌后续将向部分测试者及订阅者推出模型,还公开了解题过程。

新智元
算法论文8

40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画

ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4训练收敛加速,微调极少参数,在多模型验证效果出色。

量子位