「DeepSeek 671B」共找到 1377 篇相关文章
梁文锋,Nature全球年度十大科学人物!
权威科学期刊《自然》公布2025年度十大科学人物榜单,梁文锋因DeepSeek模型对AI领域的重要贡献与变革性影响成功当选。此外,中国研究员杜梦然也因相关研究入选,还有多位其他领域人物因各自成就上榜。
美国版梁文锋来了
美国互联网券商巨头Robinhood的CEO Vlad Tenev投身AI创业,与Tudor Achim联合创立Harmonic AI,从数学突破开始,目前已完成B轮融资,估值达8.75亿美元,目标是构建数学超人类的AI系统。
半在线RL新范式UI-S1,使得GUI Agent既稳定又规划长远
现有AI训练方法在GUI自动化中各有弊端,本文提出半在线强化学习范式,训练出UI - S1 - 7B模型,性能提升显著,还提出新评估指标SOP,是迈向实用化AI智能体的重要一步。
Transformer | 一文带你了解Embedding(从传统嵌入方法到大模型Embedding)
文章介绍Embedding基础知识,从传统统计方法到如今大模型用例演变过程。涵盖传统、静态、上下文及大模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以图展示。
MoE推理「王炸」组合:昇腾×盘古让推理性能狂飙6-8倍
在通往AGI进程中,MoE模型成大模型推理提效关键。华为推出Pangu Pro MoE 72B模型,经多方面优化,推理性能提升6 - 8倍。还采用多种策略和算法,在昇腾不同平台展现卓越性能,为大模型落地提供支撑。
MiniMax ARR暴涨500%,token暴涨2000%!这就是Agent红利吧
MiniMax最新数据显示,今年8月ARR超8亿美元,较2月增长约5.3倍。2026年上半年收入同比涨283.1%,B端收入占比升至80%。其增长得益于用户增多和用法改变,M3、H3模型表现出色。
807道灵魂拷问后,中国模型竟在「意义测试」中夺冠!
在美国新基准测试FAI - C中,中国开源模型Qwen3夺冠,DeepSeek的R1跻身前六,力压美国明星实验室顶级模型。该测试由前英特尔CEO帕特·基辛格所在公司Gloo推出,旨在让AI直面深层问题。
科学家证实磁场真的能改变基因表达,但它的要求非常严苛
韩国东国大学 Jongpil Kim 团队研究证实磁场能改变基因表达,该团队绕开 ferritin 路线,通过全基因组筛选找到关键基因 Cyb5b,拼起磁场→基因表达分子链,并在抗衰老、阿尔茨海默病、抑郁症血清素调控方面做了活体验证。
NVIDIA技术沙龙《强化学习流水线优化:性能分析与 Rollout加速》演讲笔记
该演讲笔记围绕强化学习流水线优化,强调用Nsight Systems做性能分析,介绍在Ray Actor添加参数及解读文件方法。给出训练/生成参数优化技巧,如Actor训练和Rollout优化,还以Qwen 2.5 7B等模型为例总结参数调优经验。
AutoGLM深夜开源,千千万万个手机Agent要站起来了。
昨天深夜智谱将手机Agent AutoGLM开源,包含手机端智能助手框架和AutoGLM - Phone - 9B模型。它为解决隐私问题给出中间态解法,有3种部署模式,虽有不足,但让个人拥有本地手机Agent成为可能。