迭代蒸馏与增强」共找到 879 篇相关文章

算法论文7

deepseek-V4算法工程技术深入浅出

文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。

Agent的潜意识
新闻资讯7

组织也能fork?Karpathy提出"代码即公司"

Karpathy提出“代码即公司”观点,认为AI驱动的组织可像代码仓库一样被复制、修改、代。传统组织因“制度性知识”难以fork,AI能将隐性知识显性化。交易公司或成首个被fork的组织类型,管理协调是核心竞争力。

AI工程化
产品应用7

小红书,再造一个更有「声」命力的社区

2026年春节,小红书开放多种AI语音新玩法,如语音发布、评论、问一问等,增强社交趣味性。但AI语音落地面临音频理解、生成活人感和响应速度等问题。小红书有天然优势,技术团队自研模型达SOTA水平。

机器之心
开源动态8

昆仑万维开源的SkyReels-V3,把马斯克请来带货了

1月29日,Skywork AI团队宣布开源SkyReels - V3多模态视频生成模型系列,涵盖三大核心能力,达业界领先。经测试表现出色,其技术有创新,且模块化设计适配性强。昆仑万维此前在视频生成领域代快,此次开源或加剧竞争。

机器之心
推荐文章7

“Skill 不就是长一点的提示词吗?”

文章回应了对'skill是长提示词'的质疑,指出差异在于提示词配套的是ChatBot还是Agent。ChatBot只能对话,Agent能调用工具干活。Skill可渐进加载,具可复用、组合、代等优势,是提示词工程化封装。

宝玉AI
产品应用8

刚刚,豆包编程模型来了,我们用四个关卡考了考它!

2025年AI编程助手分化为IDE增强和Agentic两条路线。当前Claude Pro有使用限制,火山引擎推出豆包编程模型Doubao-Seed-Code。它在多项评测表现优异,具备长上下文等能力,经四关测试实力强,价格也实惠,或成完美平替。

机器之心
新闻资讯7

长上下文窗口、Agent崛起,RAG已死?

技术代下“RAG已死”论调出现,向量数据库Chroma创始人主张用上下文工程框架取代对“RAG”的狭义依赖。文章梳理业界不同观点,有人认为RAG在进化,有人称其成工程学科,也有人觉得会被Agent和长上下文取代。

机器之心
产品应用7

⼤模型是万能的吗?探索机器学习+⼤模型在某出海投资业务的应⽤

本文基于公共云大客户出海投资业务案例,探讨用AI大模型结合机器学习算法构建投资预算预测与分配系统。历经三版方案代,从纯大模型到引入机器学习算法,目前项目处于落地阶段,有望实现多方共赢。

阿里云开发者
产品应用7

苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理

今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。

AI前线
产品应用8

刚刚,HiDream-O1-World首秀登顶,原生全模态UiT架构打造「可交互时代」

过去三年,AI 内容生成行业虽有技术代,但用户与模型交互仍单向。智象未来发布全球首款原生全模态交互式世界模型 HiDream - O1 - World,它基于 UiT 架构,在评测中表现出色,解决两大行业难题,应用前景广。

机器之心