「Qwen3 - 0.6B」共找到 3313 篇相关文章
Claude最强领域被GPT反超!GPT 5.5最难编程基准破0
编程领域曾由Claude引领,如今GPT 5.5在大模型解决率为0%的最难编程基准上实现突破。程序重建基准测试(ProgramBench)考验严苛,过往模型解决率为0,GPT 5.5高和超高推理模式成功破局,展现了不同解题风格。
3 亿美元 ARR、估值超 20 亿美元,演语科技是怎么做 ToC 应用增长的?
AI应用难做,演语科技却完成近3亿美元B+轮融资,估值超20亿美元,ARR超3亿美元。其成功在于找准付费人群、做厚应用、激进增长,让产品功能转化为收入,为AI应用商业化提供范例。
模型训练最重要的依然是 Scaling —— 对话阿里通义千问 Qwen 多语言负责人杨宝嵩 | Open AGI Forum
本文是对阿里通义千问Qwen多语言负责人杨宝嵩的专访。他透露Qwen一开始就将国际化视作核心战略,团队建立文化标注体系确保内容安全合规。还谈到多语言推理难题及应对策略,认为扩大模型规模和数据量仍重要,合成数据是延续Scaling Law的关键。
AI三国杀!OpenAI狂卷,DeepSeek封神,却被Mistral偷了家?
中美忙着堆算力打AI战,欧洲Mistral杀出,推出Large 3和Ministral 3,全开源、多模态、能落地。Large 3规格高,Ministral 3小而强,可跑在多设备上。Mistral还想成平台,挑战巨头。
12ms!一个仅8M的语音停顿检测模型
语音助手准确判断用户是否说完是挑战,Smart Turn将决策过程缩至12毫秒。其v3.1版有改进,新增数据集提升英语识别准确率,推出未量化版本推理更快,8MB模型性能优,已在HuggingFace开源。
GPT-5.2刚发布就要被网友玩坏了~
11月19日Gemini-3-pro发布,一周抢1200万用户,OpenAI市值受威胁,GPT-5.2提前上线,专注推理、速度和削减幻觉。文中介绍其技术要点,也展示网友实测情况,如被Gemini-3.0碾压等。
摩尔线程算法一鸣惊人,图形学顶会夺银!已开源
12月17日,在SIGGRAPH Asia 2025上,摩尔线程凭借自研技术LiteGS在3DGS重建挑战赛中获银奖。3DGS是革命性3D场景表示与渲染技术,摩尔线程开源3DGS基础库LiteGS,实现全链路协同优化。
字节 AI 卷出新高度:豆包试水“上下文定价”,Trae 覆盖内部80%工程师,战略瞄定三主线
近日字节分享 AI 技术发展三主线,6 月 11 日火山引擎有系列发布更新。豆包 1.6 实行上下文定价,成本降低;超 80% 字节工程师用 Trae;视频生成模型 Seedance 1.0 Pro 具性价比;智能体带动强化学习算力攀升。
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
为训推加速!全新FlashQLA注意力算子库开源
自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。