「Qwen大语言模型」共找到 8066 篇相关文章
盘一盘,2017年Transformer之后,LLM领域的重要论文
本文梳理2017年Transformer后LLM领域重要论文。如提出Transformer架构的论文成现代AI基石;介绍GPT - 3的论文确立‘大模型 + 大数据’缩放定律,引领LLM军备竞赛等。还列举各论文内容与影响。
「超级智能」终极拼图曝光!小扎连撬OpenAI灵魂研究员,Meta梦之队已成形
扎克伯格从OpenAI等机构挖来九位AI顶级人才,涵盖数据、模型、推理等领域,组建无短板「梦之队」,全力冲刺Meta通向超级智能的最后一跃。此前Meta曾高价挖角OpenAI联合创始人,均遭拒绝。
成立 5 年最高估值超百亿,摩尔线程之后,又一家AI芯片独角兽争当“国产 GPU 第一股”
6月23日,沐曦集成电路IPO辅导完成,离A股上市更近一步。它成立于2020年,专注高性能GPU,产品应用广,还与书生・浦语3.0合作。虽曾被曝裁员,但已完成8轮融资。当下国产GPU厂商扎堆IPO,适配DeepSeek或带来机遇。
Anthropic CEO:人的幻觉比AI 更多!这是真的吗?
Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。
这些关于研发提效的深度实践,值得每一位开发者关注 | AICon
6月27 - 28日AICon北京站上,一线大厂技术大牛将分享“AI赋能研发提效”经验,涉及AI编程范式革新、代码智能化落地、研发流程优化等多方面,呈现技术演进与落地路径。
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。
21
本文聚焦vllm v1中管控模型分布式推理的核心Executor部分,介绍其4种类型及适用场景,以mp类型为例阐述Executor - Workers架构,还说明了大小数据在两者间的传输机制及原理。
刚刚开源的学术论文阅读神器,AI 驱动的个性化“暴躁教授”助你攻克论文!
学术论文阅读常因晦涩内容和语言壁垒让人望而却步。Mad-Professor是开源的AI驱动学术论文阅读工具,集成多种功能,通过AI问答和语音交互解答疑惑,赋予个性化角色,让阅读体验高效且生动。
吴恩达新作:87%推理token用不着,丢掉反而快3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
让 AI Scientist 真正“做出材料”, 鼎犀智创完成数亿元 Pre-A 轮融资
AI新材料研发公司鼎犀智创完成数亿元Pre - A轮融资,资金用于模型及技术研发等。该公司技术路线独特,案例显示能大幅缩短研发周期,还将中试放大纳入体系,推动材料研发走向平台化。