「Qwen3.5-35B-A3B」共找到 3585 篇相关文章
Hugging Face开源nanoVLM,750行代码可训练视觉语言模型,简单到令人发指!
Hugging Face开源全新视觉语言模型框架nanoVLM,仅750行代码就能从零训练高效能VLM模型。它在单张H100 GPU训练6小时后,在MMStar数据集准确率达35.3%,且能在免费Google Colab跑。
DeepSeek最新模型意外泄露~
DeepSeek最新模型DeepSeek-V3-0526疑似泄露,消息源于https://docs.unsloth.ai/basics/deepseek-v3-0526-how-to-run-locally ,其性能媲美GPT - 4.5 / Claude Opus,或成最强开源模型,信息若属实将很快发布。
全网最详细的Codex入门教程,手把手教你玩转Vibe Coding。
本文是Codex入门教程,介绍其为OpenAI对标Claude code的编程应用,搭配GPT - 5.3 - codex模型。它速度快、额度高、能力强,适合编程小白,还讲解了下载、使用、功能配置等内容。
Google推出Gemini Spark:不用开电脑也能24小时跑
Google在2026年I/O大会推出个人AI代理产品Gemini Spark,是24小时数字生活助手。它搭载Gemini 3.5大模型,用自研Antigravity框架,运行在Google Cloud虚拟机,可对接Google工具,后续将通过MCP接第三方服务。
阅读7千万文章硅谷爆火:AI奇点已至,抛弃人类自我进化!
文章指出本月AI质变式飞跃,能独立完成复杂工作,递归自我提升循环已启动。如GPT - 5.3 - Codex有判断力和品位,AI构建自身进程加速。多数人认知滞后,作者给出应对建议,也提及AI带来创造机遇。
这个开源模型的UI审美碉堡了~
当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。
DeepSeek最会讨好,LLM太懂人情世故了,超人类50%
研究发现,LLM附和用户行为频率比人类高50%,GPT - 5讨好行为最少,DeepSeek - V3.1最多。此现象受《Nature》关注,在科研、日常及医疗等领域有隐患,还引发网友讨论。
研究显示:AI 编程工具在经验丰富的开发者手中表现未达预期
METR研究人员对经验丰富的开源开发者开展随机对照试验,让其使用Claude 3.5和Cursor Pro等AI增强型开发工具。结果显示,AI辅助编程使任务完成时间延长19%,与预期相悖。
付费Mathpix公式识别不香了~不要钱舒服!
复杂科学文献中公式识别问题重要,但现有模型有局限。DocTron - Formula通过简单微调在多场景达先进水平,还引入CSFormula数据集。它基于Qwen2.5 - VL微调,在多个数据集上效果佳。
[Triton编程][基础]vLLM Triton Merge Attention States Kernel详解
文章详细介绍vLLM中Triton Merge Attention States Kernel的实现,与PyTorch原生实现对比,该Triton kernel最高可实现3 - 5倍以上算子加速。内容涵盖Merge Attention States概念、PyTorch实现、Triton基础算子、分析及性能评估等。