经验驱动训练」共找到 3139 篇相关文章

开源动态8

103K「硬核」题,让大模型突破数学推理瓶颈

现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。

机器之心
新闻资讯7

Google搜索转型,Perplexity入不敷出,AI搜索还是个好赛道吗?

Google在I/O开发者大会宣布上线由Gemini驱动的高级AI搜索模式AI Mode,此前其因转型冲击收入而犹豫。Perplexity访问量增但亏损,AI搜索赛道融资减少,大厂抢占空间,产品转垂类,商业化待探索。

Founder Park
新闻资讯7

刚刚,北大校友Lilian Weng自曝公司首个产品?一篇论文未发,估值却已90亿

OpenAI前安全副总裁Lilian Weng疑似曝光90亿估值新公司Thinking Machines首个产品——手动调参仪表盘,训练中可手动调超参数。OpenAI也有AI硬件野心,设想让ChatGPT成全能硬件助手。

新智元
算法论文8

「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!

大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。

机器之心
产品应用9

基于 Qwen3.8-Max 构建 AI 合同精审系统:文档解析、多轮条款分析 Pipeline 工程实战

本文分享基于Qwen3.8-Max大模型+Python Flask搭建AI合同精审系统的完整工程实战,包含环境配置、项目架构、核心模块开发,记录开发踩坑经验,附AI与人工审查的实测对比数据,适合中小企业合同初审使用。

机器学习AI算法工程
算法论文8

ECCV 2026 | 一段视频,重建一个可仿真的动态世界

机器人走出实验室后,训练数据需覆盖真实世界情况。OVOW由多团队完成,被ECCV 2026接收。它从单目视频出发,输出可编辑、可碰撞的实例级Mesh,串联视觉基础模型完成流水线工作,能用于物理仿真。

机器之心
推荐文章7

MiniMax 怎么做 Agent:Model-Harness 协同只是第一步,还有 Inference-Harness 协同

本文介绍了 MiniMax 在 Agent 层面的实践。从内部飞书 bot 起步,发展成桌面应用 MiniMax Code,形成训练 - 服务闭环。还阐述 Agent 对模型优化迭代的作用、自研 Agent 优势,指出 AGI 是闭环递归自我改进系统。

Founder Park
开源动态7

Meta 开源 Brain2Qwerty v2:非侵入式脑机接口语句解码准确率达到 61%

Meta 近日开源非侵入式脑机接口系统 Brain2Qwerty v2,能将人脑想法解码为完整语句,平均单词识别准确率达 61%,远超其他非侵入式方案。其采用三阶段深度学习模型,代码和训练数据已公开。

InfoQ
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。

量子位
算法论文8

当SFT遇上RL:基于样本学习阶段的动态策略优化机制

在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。

量子位