Qwen系列」共找到 720 篇相关文章

Product Application7

文档OCR新范式0.84 页/秒,吊打MinerU Qwen2.5VL

MonkeyOCR采用SRR三元组范式,简化多工具管道,避免整页文档处理低效率。与MinerU、Gemini 2.5 Pro等对比,性能表现优,处理速度达0.84页/秒,但对扫描件效果欠佳,架构含多模型,可通过特定地址测试。

CourseAI
算法论文7

R1/Qwen训练新范式:无需继续训练,直接“算”出权重,提效500%

DeepSeek - R1爆火让RLVR成大模型后训练焦点,但训练代价高昂。学者发现RLVR中LLM权重和输出概率呈线性变化,提出“权重外推”等方法,实现最高6.1倍训练加速,RL - Extra在多榜单展现高效率。

PaperAgent
新闻资讯7

对谈 Skyris 张宇诺:AI 陪伴机器人会飞,理所应当 | 00 后创业者系列

这是对 00 后创业者张宇诺的访谈,他介绍了 Skyris 会飞陪伴机器人的设计灵感、特点及优势,还谈及创业经历、对陪伴的理解,以及产品研发难题、规划等,最后提到 GAIR 2025 大会将邀 00 后 AI 创业者分享。

AI科技评论
算法论文7

从BERT到T5再到Qwen3:关于Embedding的八点总结

哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。

PaperAgent
开源动态7

vLLM Ascend超越MindIE? 昇腾推理Qwen3与DeepSeek R1 Distill性能实测

国内开发者在昇腾NPU上进行大模型推理面临挑战,华为MindIE推理引擎使用门槛高。昇腾联合vLLM社区推出vLLM Ascend插件。本文用GPUStack平台实测其与MindIE性能差异,得出两者在不同场景各有优势的结论。

AI工程化
新闻资讯7

Chimer AI 黄祯:自然而然地干了离经叛道的事 | 00 后创业者系列

本文是对 00 后创业者黄祯的访谈。他大学休学创业,先尝试珠宝等行业,后聚焦服装产业。起初做 SaaS 工具,因国内市场不佳转向 Agent 与 SaaS 结合,还获吴世春融资,分享了创业经历、思路及产品特点。

AI科技评论
开源动态8

欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者

欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。

AIGC开放社区
新闻资讯7

心芯相栖黄思铭:我们做了只像狗狗一样的小猫 | 00 后创业者系列

2023年,黄思铭因世界变化快、大学教材陈旧而从杜克休学。他结合自身幸运经历,想借AI普及优质关系。2024年6月,其团队上线虚拟角色小喵希拉,教AI与人做朋友,目前已获不少用户。

AI科技评论
产品应用7

神秘模型排名超 Gemma 4 31B:不跟 Qwen 硬刚,主打“快”和“省 token”

OpenRouter的Elephant模型Trending榜排名超Gemma 4 31B。它是100B参数隐身模型,主打‘智能效率’,在速度、token消耗、指令遵循等方面与其他100B级别模型对比各有优劣,代表极致轻量路线。

AI前线
开源动态8

史上最大高质量科学推理后训练数据集开源,快速让Qwen3等变“科学家”

上海创智学院、上海交通大学发布开源科学推理后训练数据集MegaScience,含约125万条问答对,覆盖多学科。它解决了现有数据集的问题,实验显示能提升模型科学推理能力,已完整开源相关组件。

量子位