「后训练技术」共找到 6022 篇相关文章
开源版Suno来了:本地跑AI音乐生成,免费、无限、完全属于你
ACE - Step UI开源项目改变AI音乐生成现状,提供本地方案。它是完整音乐工作站,虽生成质量与Suno有差距,但在费用、隐私等方面优势明显,预示AI音乐生成开源生态崛起。
ACL 2026 | LCA:DeepSeek 长文本加速神器,90% KV 缓存缩减 + 2.5 倍推理提速
琶洲实验室等团队提出潜在空间压缩注意力(LCA),入选 ACL 2026。LCA 突破传统注意力机制瓶颈,适配不同大模型,降低硬件门槛与成本,提升推理效率。论文与代码已开源。
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
browser - use团队开源Claude Code技能video - use,可自动去口癖、加字幕、调色等。它通过转录文本和按需视觉合成图让LLM理解视频,有完整流水线和设计原则,还给出使用方法。
自主Agent时代群雄逐鹿,紫东太初何以走出一条中国特色AGI之路?|甲子光年
2026年OpenClaw掀起全民AI热潮,AI进入自主Agent时代。中科紫东太初依托中科院自动化所,以自研紫东太初ScienceClaw从AI4S赛道切入,破行业痛点,走出中国特色AGI发展之路。
手撕、翻滚、暴力砸地!最「扛造」的灵巧手来了
4月17日智元合作伙伴大会上,临界点AGILINK发布三款新品,包括旗舰级工业绳驱灵巧手OmniHand 3 Ultra - T、普惠型耐造小手OmniHand 3 Lite和全面焕新的具身夹爪OmniPicker 3,各有优势且兼顾量产与开源。
将庞大3D世界装进手机!李飞飞Spark 2.0开源
李飞飞团队开源核心技术Spark 2.0,可优化3D世界,让普通设备通过浏览器流畅访问交互。它有自动选细节、分批加载、优化存储三绝招,适配主流框架,有望改变与数字世界互动方式。
刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!
蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。
ICRA 2026|NUS邵林团队提出T(R,O) Grasp:刷新跨智能体灵巧抓取SOTA,实现5FPS动态环境交互
新加坡国立大学邵林团队提出T (R,O) Grasp,这是基于物体—机器手空间关系建模的图扩散架构,有跨智能体统一表征能力,在多种智能体上平均抓取成功率达94.83%,刷新跨智能体灵巧抓取SOTA。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
OpenClaw 实战:一个人、一台 Mac、六个 AI Agent — 从"能聊天"到"能干活"的工程实战
本文分享 OpenClaw 实战经验,介绍 1 编排者 + 5 专业 Agent 团队运作,阐述上下文管理、记忆成长、多 Agent 协作等核心工程问题及解法,还给出系统搭建步骤和技术栈参考。