全参数微调」共找到 2642 篇相关文章

新闻资讯8

拥有Github 的微软终于出手,发布一键生成栈应用的GitHub Spark!

微软发布GitHub Spark,能以自然语言生成栈应用并一键部署,默认用Claude Sonnet 4。它遵循微应用理念,有强大功能体系,深度集成GitHub。开发者看法不一,目前向Copilot Pro+用户开放,或改变市场格局。

AGI Hunt
算法论文8

NeurIPS 2025 | 告别量扫描!浙大提出COIDO:破解多模态数据选择「高耗」难题

浙大提出 COIDO 框架解决多模态数据选择「高耗」难题。它摒弃量扫描,用轻量级评分器和小样本采样,将重要性和多样性的优化统一。实验显示,它性能与效率双优且有强泛化性。

机器之心
算法论文8

27M参数战胜GPT-4!脑启发的分层Reasoning引擎如何重塑LLM

当前大语言模型(LLM)核心架构存在根本性缺陷,受大脑分层处理和多时间尺度启发,本文提出仅2700万参数的分层推理模型(HRM),免预训练与CoT标注,单次前向传播解决复杂任务,在ARC - AGI上超越GPT - 4等LLM。

深度学习自然语言处理
产品应用7

GLM4.5实测:审美不如R1,栈还不大可用,别急冲

7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。

AI产品黄叔
新闻资讯8

硅谷这一夜,属于中国机器人!图灵奖得主、英伟达大牛来了

美西4月28日,具身智能球性峰会GEIS在硅谷落幕。中国公司魔法原子发起,图灵奖得主演讲,英伟达等科学家对谈。会上发布世界模型Magic - Mix、灵巧手H01和人形机器人MagicBot X1三款产品,展现栈自研实力。

新智元
推荐文章7

2025中国力学大会AI+分享 | 国防科技大学刘杰研究员:AI赋能PDE流程求解

在2025中国力学大会AI+分享中,国防科技大学刘杰研究员介绍AI赋能PDE流程求解。刘杰是研究员、博导,在并行算法等领域成果颇丰,主持多项项目,获多个奖项。

力学与人工智能
算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更具性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位
推荐文章8

一文解析:AI 智能体 8 种常见的记忆(Memory)策略与技术实现

本文剖析8种常见AI记忆方案,如量记忆、滑动窗口等,分析其原理、特点和适用场景,还给出模拟代码助理解。不同策略各有优劣,适用不同对话场景,能为项目评估、选择和实现Memory方案提供参考。

AI大模型应用实践
新闻资讯7

4B Qwen3逆袭671B DeepSeek!字节DAPO微调方法这么猛的吗

最新模型Jan - nano引发关注,它在智能体任务上超671B的DeepSeek - V3 0528,在SimpleQA基准获80.7分。它基于Qwen3 - 4B用字节&清华DAPO微调方法。其研发团队是Menlo Research,有开源产品和长远规划。

量子位
新闻资讯8

西湖大学修宇亮:数字人重建,慢慢都会变成基础模型的微调任务 | GAIR 2025

12月13日,西湖大学修宇亮在GAIR 2025分享数字人重建进展。其团队成果UP2You将建模时间从4小时缩至1.5分钟;ETCH获更准确内部人体结构;Human3R可实时动态重建人物场景。他认为未来数字人重建将成基础模型微调任务。

AI科技评论