「Kimi K2 Thinking」共找到 876 篇相关文章
DeepSeek有点含蓄了,实测V3.1有进步,编程等个别场景硬刚GPT-5
DeepSeek悄悄更新V3.1,官方仅提及上下文长度拓展至128K。实测其代码能力与前端审美提升,逻辑推理也有进步,在编程等个别场景能硬刚GPT - 5,但处理复杂任务还有距离,更新不大却有进步且降价。
阿里 Qwen3:持续开源,SOTA 连连!
很多从业者有‘闭源模型一定比开源强’的刻板印象,而 Qwen 正打破此认知。最近阿里连发三款模型 Qwen3-235B、Qwen3-Coder、Qwen3-235B(Thinking),在多方向发力且拿下多个开源榜单第一。
小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一
6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。
一个新网站上线不久便从谷歌获得了15859次曝光和5689次点击,实际UV约7K。而良辰美的网站,通过AI辅助写作,更是达到了21.5万次曝光和2.85万次点击。谷歌的排名机制对新站公平,关键在于如何抓住机会。
GPU-MODE Leaderboards之nvfp4_gemv代码阅读
文章围绕GPU-MODE的nvfp4_gemv竞赛rank1代码展开,先介绍问题及官方baseline,后详细解读rank1代码,含数据加载、线程模型等,还剖析核心计算函数,最后总结代码在缓存控制、数据格式等方面的调优亮点。
重磅!OpenAI时隔五年再发布开源模型gpt-oss:开源SOTA,可在16g笔记本运行
谷歌推出Genie 3后,OpenAI宣布发布开源推理模型gpt-oss,有gpt-oss-120b和gpt-oss-20b两个型号,采用混合专家架构和4位量化方案,能快速推理,原生支持128k上下文长度。文章还介绍了模型表现、训练等情况。
Altman 秀新模型“翻车”,谷歌补刀躺赢!OpenAI 前员工爆肝 3 天,编程再赢老东家模型!
近期,OpenAI 携多款未公开新模型亮相。在 IMO 竞赛中,其宣称新模型获金牌,谷歌 DeepMind 的 Gemini Deep Think 也达金牌水平,但网友对二者评价不一。此外,‘o3 Alpha’疑上线,前 OpenAI 员工还在编程赛中击败 OpenAI 模型。
英伟达护城河被AI攻破,字节清华CUDA Agent,让人人能搓CUDA内核
近日,字节跳动Seed团队和清华AIR的CUDA Agent引发轰动。它能编写经优化的CUDA内核,性能超torch.compile等。研究发布CUDA - Agent - Ops - 6K数据集,介绍系统管线设计、训练流程,实验结果佳,但有未对比复杂编译器等局限。
Qwen3又又又发布了新模型~~~
Qwen3团队继发布`Qwen3-235B-A22B-Instruct-2507`和`wen3-235B-A22B-Thinking-2507`后,又发布`Qwen3-Coder-30B-A3B-Instruct`。该简化模型性能和效率出色,有多项关键增强功能,且是非思考模型,输出效率高。
姚顺雨对着唐杰杨植麟林俊旸贴大脸开讲!基模四杰中关村论英雄
清华发起AGI - Next前沿峰会,智谱唐杰、Kimi杨植麟、阿里林俊旸、姚顺雨等大咖齐聚。他们探讨AI发展方向,如唐杰认为Chat阶段结束,应走向做事;杨植麟强调做模型要创造世界观;林俊旸介绍千问进展,还讨论了路线分化、自主学习等话题。