「豆包输入法」共找到 696 篇相关文章
高中辍学,22岁入职OpenAI成为「研究科学家」,他是怎么做到的?
文章讲述22岁高中辍学的Gabriel Petersson入职OpenAI成为研究科学家的故事。对比传统学习路径,介绍他自顶向下的学习法,分析其可行原因、适用场景,还给出行动建议,指出学位价值在改变。
张小珺对话李想:3小时长谈总结(AI、VLA与组织进化)
张小珺半年前与李想3小时长谈,围绕AI展开多话题探讨。李想认为AI应成生产工具,赞赏DeepSeek,还分享VLA架构、理想终局规划,提出管理心法,思考AI与人关系。
腾讯开源混元世界模型1.1,视频秒变3D世界,单卡推理仅需1秒
腾讯发布并开源混元世界模型1.1,是统一的端到端3D重建基座大模型。它支持从多视图或视频一键生成3D世界,单卡秒级推理完成高精度重建,性能达SOTA,还具多特性,打破技术壁垒。
百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节
百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在多能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。
国产大模型新SOTA:蚂蚁万亿级旗舰模型赶超GPT-5
蚂蚁集团开源万亿参数旗舰大模型Ling-1T,属Ling 2.0家族。它激活比例低降低运算成本,训练有“Ling缩放定律”等方法,多项测试超主流模型,不过处理超长上下文成本较高。
Qwen-Image-Edit 更新:多图编辑支持,单图一致性增强
阿里8月发布的Qwen-Image-Edit迎来月迭代版本Qwen-Image-Edit-2509,可在https://chat.qwen.ai/使用。更新支持多图编辑,有多种玩法,还提升单图一致性,在人物、商品、文字编辑上表现显著。
实测国内首个对话式AI音乐创作Agent:聊个天就能谱曲填词混剪生成MV
实测国内首个对话式AI音乐创作Agent Tunee,玩法像Suno+ChatGPT结合体。它操作简约功能全,能反复修改创作,还具备多模态内容处理能力,虽有小瑕疵,但体现国产AIGC应用发展趋势。
国科大 | 提出进化算法:EvolKV,自适应分配KV Cache,预算降至1.5%!
键值缓存(KV cache)是大模型快速运行核心技术,但输入文本越长,存储和处理问题越突出。国科大提出进化算法EvolKV,自适应分配KV Cache,实验显示其效果显著,预算可降至1.5%。
无需训练的LLM对齐方法综述
大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。
梳理SGLang中DP Attention及其Padding问题
作者梳理SGLang中DP Attention及其Padding问题。介绍DP Attention背景、流程,指出padding分max和sum模式,旧版sum padding浪费计算、影响cuda graph使用,v0.4.10后有优化,max padding仍待完善。