「DeepSeek 1.5B」共找到 4047 篇相关文章
万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI
10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用大模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。
您猜怎么着?Grok 4进决赛,大模型对抗赛Gemini全军覆没,马斯克「装」起来了
谷歌举办的 Kaggle AI Chess 比赛中,半决赛 Grok 4 击败 Gemini 2.5 Pro 进决赛,o3 也战胜 o4 - mini 晋级。Grok 4 与 Gemini 2.5 Pro 对决焦灼,最终 Grok 4 涉险晋级,明天将与 o3 争夺冠军。
只需1/4预算,性能反超基线:阿里高德提出Tree-GRPO,高效破解智能体RL难题
阿里高德提出Tree - GRPO方法解决智能体RL难题。它以智能体步骤为节点树搜索,在11个数据集中更省预算、表现更好,能在1/4预算超GRPO基线,解决了Rollout成本高和监督稀疏问题。
The Batch: 859 | Qwen3 的自主智能新进展
不到两周前 Kimi K2 超越其他开源非推理模型,如今阿里巴巴发布基于早期 Qwen3 - 235B - A22B 的三款新大语言模型权重,介绍了输入输出规格、架构设计、性能表现、使用方式等,还进行了性能对比。
蚂蚁抛弃向量推荐!用8B小模型构建「用户“话”像」,实现跨模型通用并拿下SOTA
2026年AI开发者关注爆款大模型应用,个性化是关键。蚂蚁集团和东北大学团队推出AlignXplore+,实现文本化用户建模新范式,有全域通用、极致迁移、实战适配特性,小参数超越基线,未来将继续探索。
基于一个MXFP8量化Kernel谈一谈如何在B200上实现高性能的Memory Bound Kernel
作者向SGLang社区提交基于CUTLASS的MXFP8 Blockscaled Grouped GEMM实现,其中包含量化Kernel。文章关注此Kernel,介绍在B200上实现高性能Memory Bound Kernel的优化技术,如整体设计、向量化与合并访问、Occupancy优化、TMA利用等。
Karpathy盛赞,啥都没有的创业公司刚融了1.8亿美元,要用小数据造强智能
AI创业公司Flapping Airplanes几乎无产品、盈利,也不急于商业化,却获1.8亿美元融资及Andrej Karpathy力挺。它专注解决“数据效率”问题,探索新思路,目标是做改变范式的研究。
The Batch: 885 | Claude 升级了
Anthropic更新中型模型Claude Sonnet至4.5版本,在性能上显著提升,还引入可变推理token预算。Claude Code智能编码工具也获功能增强,新增Claude Agent SDK等。测试中Claude Sonnet 4.5表现优异,Anthropic重心转向编码与职场生产力。
GPT-5核心推手闪电跳槽,Anthropic CEO高调炫耀员工留存碾压OpenAI,“AI第一公司”光环崩塌?
OpenAI后训练负责人、GPT - 5核心推手Max Schwarzer跳槽至Anthropic,此前也有多位技术领袖离开。OpenAI在商业版图扩张与伦理争议并存下,正从参数军备赛转向体验护城河,同时加速商业与政治布局,但面临人才流失等问题。
OpenAI发布ChatGPT世代首个开源模型gpt-oss,4060Ti都能跑得动。
8月6日晚,OpenAI发布ChatGPT世代首个开源模型GPT - oss,有120B和20B两款。模型原生支持4 - bit量化,性能损失小,低配置显卡也能运行。跑分表现不错,还介绍了使用途径,虽有不足但改变开源社区格局。