「有监督微调」共找到 6465 篇相关文章
机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛化学习 | ICML2025
美国东北大学和波士顿动力RAI提出HEP框架,首创“坐标系转移接口”,有极简高效分层结构、空间对称性自然泛化、创新型体素编码器等亮点。它基于分层策略和接口,提升机器人操作灵活性与泛化性,论文被ICML2025收录。
具身智能猛将再狂揽近6亿融资!机器人Moz1卷入办公室,全力冲刺万亿赛道
2025年具身智能赛道爆发,全球科技巨头与初创公司竞技。千寻智能获近6亿PreA+轮融资,其商用机器人Moz1实力强,自研Spirit v1与OneTwoVLA模型表现出色,以独特商业策略布局万亿市场。
突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO
先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。
4人团队,连做两款AI教育爆款,AI时代小团队创业取胜指南
Oleve是仅4人AI创业公司,年化收入达600万美元。旗下Quizard和Unstuck AI成爆款。其成功在于技术敏锐,用OpenAI Codex起步;有“精益增长”策略;且实现流程全面自动化,为小团队创业提供样本。
【访谈】在黑箱中寻找自我显影——对话苏仲尧|三影堂厦门
苏仲尧个展《打开黑箱说亮话》聚焦摄影人机互动,引向对‘技术黑箱’思考。创作分三阶段,从文字照片到金属板,再结合AI。他将创作主导权回归自身,借作品探讨技术与人关系及当下处境。
Qwen3-Embedding 全揭秘:从技术到服务,打造高效AI产品的关键路径
文章全面揭秘 Qwen3-Embedding,介绍其核心原理、优势、应用场景。还给出在 PAI 和百炼平台的使用方法,含部署、推理、微调等。通过对比实验,凸显其低延迟、低成本特点,未来将成语义理解核心设施。
00 后天才团队,发布全球首个 A 股金融博弈智能体应用
00后团队推出全球首个A股金融博弈智能体应用FinGenius,内测就吸引众多用户。通用AI在A股“水土不服”,而它有16个智能体分工协作,30秒出报告,还集成MCP协议,愿景是重塑金融行业。
无需验证器的RL:RLPR解锁LLM通用推理潜能
现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。
性能暴涨50%!谷歌、微软、OPPO 联手开源Agent “经验炼金术”
谷歌DeepMind、微软研究院、OPPO等机构开源`AGENT KB`项目,提出并实现“AI经验库”概念。它有“师徒模式”工作流,设计了从“原始日志”到“结构化经验”的构建流程,应用时分层调用知识,能让Agent性能飙升。
刚刚,H20重返中国!老黄亲自斡旋,还有特供版RTX PRO
英伟达官宣恢复向中国销售H20,并推出全新NVIDIA RTX PRO GPU。此前H20因贸易限制被禁售,此次解禁或是老黄来华大礼。不过H20已属‘上个时代产物’,且有新‘继任者’B30。