四段式预训练」共找到 2358 篇相关文章

算法论文8

人格向量:大模型性格的数学解码与精准操控

大语言模型在应用中会出现危险行为偏移与训练引发的非预期偏移,传统方法难监控干预。本文发现人格特质在线性方向表现为“角色向量”,实现提前预测、实时监控和主动控制,为AI安全提供数学框架。

深度学习自然语言处理
新闻资讯8

2025「中国最具价值 AGI 创新机构 TOP 50」发布

2025年中国AI行业新应用、新产品不断涌现。Founder Park从商业价值创新等维度选出50家AI创业先锋,涵盖大公司新产品、垂直赛道头部公司和初创企业等,还介绍了如阿里生意管家、ACE Studio等众多创新产品。

Founder Park
开源动态7

Mem0,用LLM给智能体解决记忆问题,开源

大模型训练后知识和记忆不再增加,智能体记忆能力发展不理想。国外Mem0针对AI记忆技术发表论文并开源,提出Mem0和Mem0g两种方案,在不同场景表现出色,已获多应用,还提供SaaS服务。

AI与安全
开源动态8

开源AI引爆热潮!GOSIM AI Paris 2025首日直击:80+位技术大咖聊模型、拼算力、秀落地

5月6日,GOSIM AI Paris 2025大会在法国巴黎启幕,80余位技术专家与学者参会。GOSIM联合创始人认为开源AI已追上闭源,AGI或由多模型组成网络。大会设大分论坛解析开源AI,还有特色单元,明日将迎PyTorch Day。

AI科技大本营
产品应用8

新一代Mac mini搭载M6开售!M5 Ultra也来了

苹果更新Mac mini和Mac Studio,带来M6、M5 Ultra芯片。M6是苹果首颗2nm制程M系列芯片,M5 Ultra为晶粒封装SoC。苹果用个档位搭建桌面Mac本地AI算力梯队,8月27日预购,9月22日发售。

新智元
产品应用7

企业微信给AI写了94份说明书,Claude Code现在能直接干活

北京时间8月17日,企业微信更新,将能力域从7个扩到12个,参考文档扩到94份。介绍了其能操作的业务品类,分析文档权重体现的产品意图,阐述三个设计细节,指出想象空间、机会及坑,强调此次更新比首次更重要。

AI Reading Hub
新闻资讯7

华为统治折叠屏

今年折叠屏市场平淡,多数厂商收缩产品线,小折叠被放弃,大折叠更新佛系。但华为逆势而上,2025年推出款机型,吃下国内超七成市场。其折叠屏越贵越好卖,因性价比打法先天不足,华为靠形态创新和品牌优势领先。

远川科技评论
开源动态8

Nanbeige4.2-3B:探索通用Agent小模型

在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。

AIGC开放社区
新闻资讯8

梁文锋叫停签约,DeepSeek百亿新融资或全面暂停;白宫控月之暗面蒸馏Anthropic Fable 5遭驳;腾讯员工晒317万年终奖被辞永不录用|Q资讯

本文汇总一周AI行业热点,有DeepSeek百亿融资或暂停、Karpathy或从Anthropic离职等消息,还涉及腾讯、360、美团等公司动态,以及多个新模型发布与技术成果。

InfoQ
算法论文8

怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据

具身智能进入数据scaling时代,VLA模型训练中数据并非越多越好。上海交大同济等校团队提出ATHENA框架,将影响函数扩展到十亿参数VLA模型,解决计算和筛选难题,实现313倍加速,实验证明其用更少数据获更好效果。

机器之心