Qwen2.5-0.5B」共找到 3917 篇相关文章

新闻资讯7

AI开始替人类调用AI!token用量已是人类5.2倍

据OpenRouter统计,截至8月10日,Agent类token用量半年涨14倍,人类仅2.8倍。差距源于用法差异,虽智能体部分token计价低,但用量大仍烧钱。省钱关键在配套,且智能体任务验收缺人手。

新智元
推荐文章8

顶尖模型离“科学家”还差得远?AI4S亟待迈向2.0时代

《Nature》研究指出,过度依赖现有深度学习模型或阻碍创新。上海 AI 实验室周伯文提出,应推动科学智能从 AI4S 迈向 AGI4S,还介绍“智者”SAGE 架构、“书生”模型及平台等探索成果,并邀同行共拓蓝图。

机器之心
开源动态8

超越GPT-5.2和Gemini-3-Pro!商汤多模态搜索、推理模型开源

商汤开源多模态自主推理模型SenseNova - MARS(8B/32B双版本),它通过强化学习整合工具,在多模态搜索与推理测试中超越Gemini - 3 - Pro与GPT - 5.2,还采用创新算法稳定训练,构建新基准评测。

AIGC开放社区
新闻资讯7

开源模型TOP5,被中国厂商包圆了

10月公开数据显示中国开源大模型占据榜单前五,阿里Qwen系列和DeepSeek影响力深远。从LMArena榜单、HuggingFace数据看,国产模型表现佳。还提及Llama 5相关传闻。

量子位
开源动态8

Kimi K2 Thinking,最强思考模型,附实测

Moonshot AI发布Kimi K2 Thinking模型,它能边思考边行动,是目前最强开源思考模型,多项指标超GPT - 5等闭源巨头。其具独特架构,有性能优势,还给出部署方式,实测表现佳。

AGI Hunt
产品应用7

基于Agent的SGLang Diffusion Kernel优化实践:Qwen-Image、FLUX.2和视频模型

本文记录基于Agent完成Qwen-Image、FLUX.2、Wan和SANA Video优化的过程,包括定位问题、写Kernel及遇到的坑。介绍SGLang Diffusion Kernel结构,分析数值敏感原因,展示各模型优化实践、无收益实验及验证流程。

GiantPandaLLM
新闻资讯7

DeepSeek-R2可能本月发布,使用华为AI芯片

Huaweicentral消息,搭载华为昇腾AI芯片的DeepSeek - R2可能8月15 - 30日发布,或媲美GPT - 5。它运行在昇腾910B芯片集群,参数规模达1.2万亿,将以低价提供API,冲击开源大模型市场。

AIGC开放社区
8

库克清空弹夹!2nm,韬定律,最强AI电脑

库克退休前火力全开,苹果发布首款2nm制程芯片M6和最强M系芯片M5 Ultra,塞进新款Mac。M6让Mac mini AI性能暴涨,M5 Ultra性能强悍,能跑大模型。但因内存短缺,高内存版限购且供货晚,价格也涨了。

量子位
新闻资讯7

Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景

谷歌DeepMind长上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5长上下文技术。他认为长上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。

Founder Park
开源动态8

中科院类脑大模型SpikingBrain,2%数据,百倍速度

中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练。

AIGC开放社区