「多阶段训练」共找到 5963 篇相关文章
天塌啦!!!这个开源项目让我失业啦,1300+ Star的开源AI画布,牛到让你怀疑~~~
介绍了 1300+ Star 的开源 AI 画布 Infinite - Canvas,它以画布为创作统一入口,有独特架构和多协议适配,具备多种实用功能、生态插件及两种画布模式,部署简单但需配置,适用于多场景,有优点也有局限。
转译:AI 为啥这么爱用破折号?
文章探讨AI爱用破折号的原因,指出让模型不用破折号很难。分析了几种解释,如从训练数据学来、因“万金油”特性、受RLHF工作者方言影响等,认为训练数据混入大量纸质扫描书是最可能的原因。
Nature Machine Intelligence颠覆有机化学研究范式,上海交大发表化学合成大语言模型
上交大AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成大模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。
投资人们都在看!「甲子引力X2025科技产业投资大会」都透露了哪些新机会? | 甲子引力X
8月21日,「渡口——甲子引力X2025科技产业投资大会」在北京举行。甲子光年创始人张一甲发布报告,总结市场趋势与投资逻辑。多位投资人参与巅峰对话、圆桌讨论,分享见解,大会还发布多个投资榜单。
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
长期以来,机器人系统多依赖专有模型,场景变化时需重新训练。如今具身智能步入下半场,它石智航通用具身大模型AWE3.7用同一颗“具身大脑”贯通多场景,回应了通用泛化命题。
腾讯的这款AI数据智能体工具Lumos,颠覆了传统的数据分析
文章聚焦腾讯AI数据智能体工具Lumos,它是Tomoro的数据智能体,采用多智能体架构解决复杂问题。文中介绍其技术思路、实践方案,如解决多智能体一致性、提升查询响应等,还提及后续优化方向。
量旋科技完成B轮融资,资本为何重注看似遥远的量子计算?|甲子光年
近日,量旋科技完成数亿元B系列轮融资。量子计算市场前景大,虽面临挑战,但产业正从技术研发迈向产业化。量旋科技选超导与核磁共振两条技术路线,其发展分三阶段,未来或与AI结合。
7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队
Transformer作者之一创立的Sakana AI带来新方法,让教师模型像人类教师一样做启发式教学,根据已知解决方案输出解释。用此方法训练的7B小模型在传授推理技能上比671B的DeepSeek - R1更有效。
让Agent系统更聪明之前,先让它能被信任
本文从系统工程视角剖析 Agent 系统问题与复杂度,指出开发中‘简单’是假象,复杂性只是被转移。介绍了 Agent 开发各阶段难点,通过案例说明其落地困境,提出将其视为系统组件,先求稳定可靠,还提及开发思路、模式及最新进展。
腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」
腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。