推理训练数据」共找到 5153 篇相关文章

开源动态8

个人电脑也能进行智能体RL训练?尤佳轩团队开源OpenTinker

伊利诺伊大学厄巴纳 - 香槟分校尤佳轩团队开源OpenTinker,这是全新‘强化学习即服务’系统。它通过解耦架构和友好API,让开发者在不同算力设备启动智能体训练,解决传统RL框架难题,指明下一代智能体基建方向。

机器之心
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
新闻资讯7

推理之父走了!OpenAI七年元老离职:有些研究这里没法做

新年伊始,OpenAI研发副总裁Jerry Tworek离职,他是编程和两大核心技术路线奠基者,攻克LLM编程和复杂推理商业化难题。他称想探索在OpenAI难开展的研究。此前已有多位核心人才出走,OpenAI或因商业化与安全问题留不住人。

新智元
产品应用8

揭秘!腾讯如何训练多智能体像专家一样设计游戏场景

腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。

腾讯技术工程
新闻资讯8

数据土壤,决胜 AI 下半场:一场关于企业 Data+AI 战略的炉边思辨

2026年初,Snowflake与InfoQ联合举办活动,汇聚多领域专家探讨Data+AI前沿。回顾2025年,大模型迭代、AI安全等带来认知突破;还围绕2026年十大战略命题思辨,如企业Data+AI平台挑战、开源闭源博弈等。

InfoQ
算法论文8

去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理

上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。

AIGC开放社区
开源动态8

近 2w Star,隐私优先,打工人新选择!

云端AI会议工具存数据泄露风险,Meetily项目主打100%本地处理,解决隐私短板。它是开源AI会议助手,能实时转录音频、区分说话人、生成摘要,数据不离开设备,在GitHub获近2万Star。

开源先锋
算法论文8

强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升

人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。

量子位
新闻资讯7

Lady Gaga进军AI生物科技:用“活体皮肤”训练模型,筛选抗衰老成分

当地时间8月21日,美国歌手Lady Gaga公开参与创办的生物技术公司Outer Biosciences及核心平台Yuna,该司用机器学习等结合离体人体皮肤,从海量化合物中找新护肤成分,已融资约2300万美元。

DeepTech深科技
开源动态8

SGLang原生支持昇腾,新模型一键拉起无需改代码

12月20日SGLang AI金融π对收官,聚焦大模型推理效率。昇腾成SGLang原生支持后端,助DeepSeek等模型免调参运行。SGLang给出推理系统工程解法,昇腾与SGLang深度共建,性能优且全面拥抱开源。

量子位