「国产开源大模型」共找到 9004 篇相关文章
这一年,DeepSeek消耗14万亿Token,编程仅占1/10,超一半用于角色扮演?
a16z和OpenRouter基于100万亿token研究揭示LLM使用情况:开源模型占三成市场,编程任务成刚需,角色扮演是金矿。还提到‘玻璃鞋效应’影响用户留存,市场分层为‘高端闭源+性价比开源’双轨制。
无需租GPU,一台24GB内存的笔记本就够了!
阿里开源稀疏 MoE 模型 Qwen3.6-35B-A3B,总参数 35B,激活 3B。它在智能体编程上超越前代,可与稠密模型媲美,支持多模态,已在 Qwen Studio 上线,还能集成第三方编程助手。
最鲁棒的MLLM!港科大开源「退化感知推理新范式」 | AAAI'26
多模态大语言模型(MLLMs)在真实世界视觉退化下性能崩溃,制约产业落地。港科大等团队开源的Robust - R1被AAAI 2026接收为Oral,提出显式结构化推理新范式,实现质量与鲁棒性双重突破。
Redis 之父:哪怕被喷我也得说,AI 远远落后于人类程序员!开发者跟评:用大模型气得我自己写代码都有劲儿了
Redis之父Antirez分享开发经历称人类程序员仍比大模型出色,举例说明在解决Redis复杂bug时,人类的创造力能想出奇特有效的解法,而大模型较难做到。开发者看法不一,有将其当助手,也有认为它会干扰思路。
谷歌放大招了,开源命令行AI编程Agent,每天1000次免费调用,编程只是基础功能。
Google推出开源命令行AI编程Agent——Gemini CLI,基于Gemini 2.5 Pro模型,免费提供每日1000次调用额度。它不仅能编程,还具备多模态能力、实时信息整合等功能,支持定制与自动化。
跳过“逐字生成”!蚂蚁集团赵俊博:扩散模型让我们能直接修改Token | MEET2026
在量子位MEET2026智能未来大会上,蚂蚁集团赵俊博称扩散架构能直接修改控制token,理论上速度更快、成本更低。他团队押注扩散架构,近期开源千亿规模LLaDA 2.0。该领域虽处早期,但发展快,吸引众多巨头和初创公司布局。
金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源
八月末上海举办的AFAC金融智能创新大赛(AFAC2026)总决赛,吸引众多顶尖选手。赛题模拟真实金融场景,涵盖数据规模、反馈少等难题。四届赛题反映金融AI技术迁徙,还开源百万金融智能数据集,构建数据飞轮。
每次画架构图都快崩溃?这个开源 AI 版 draw.io 一句话帮你搞定
Next AI Draw.io是基于Next.js + draw.io的开源Web应用,给draw.io加了AI大脑。它能让用户用自然语言画图、改图、补图,解决画架构图等耗时费力问题,有诸多功能亮点,适合特定人群。
全球闲置算力训个模型,性能媲美R1,老黄天塌了!Karpathy曾投资它
全球首个分布式RL训练模型INTELLECT - 2发布,整合闲置算力完成训练,成本降低,性能媲美DeepSeek - R1。其采用分布式异步强化学习范式,团队开源四大关键组件,还获Karpathy等投资,未来有多项计划。
HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴
蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。