「Skill训练框架」共找到 3736 篇相关文章
仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%
Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。
人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!
上海交大开源端侧Agent全栈工具链MobiAgent,将构建手机Agent全流程开放。它在真实场景性能超GPT - 5,还设计“潜记忆加速器”,通过三步养成Agent,评测表现出色,降低移动智能体开发门槛。
太强了 Yan!腾讯打造的全能交互视频生成引擎
腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。
年度AI论文!全球三大顶尖模型的防蒸馏机制全面告破:小模型“套出”大模型隐藏思维链,Kimi-K3重现概率异常
这篇论文指出三大前沿AI模型厂商API有密码学旁路漏洞,攻击者用轻量级模型就能恢复大模型隐藏思维链数据。还揭示部分模型训练或借鉴大模型思维链,此漏洞也致企业数据隐私安全问题。
一个月暴涨3K star,这是我见过最好用的AI生成PPT项目了!
职场人做PPT常耗在调格式等方面,现有AI工具多有缺陷。`dashi-ppt-skill`项目可生成网页版PPT编辑器,有多种主题、版式和控件,功能丰富,能本地完成操作,还介绍了安装和使用方法。
人多不管用!智能体团队别盲目扩张,最新综述给出三大维度
随着大语言模型驱动的多智能体系统快速发展,核心问题是有些系统规模扩大后会失稳、低效。美国、英国和澳大利亚研究人员提出三维分类框架描述大规模智能体网络,指出真正决定系统表现的是三种机制组合。
Claude Code 2.1 发布:一口气更新了80多个功能特性
2026年1月7日Claude Code发布2.1.0版本,后又跟了2.1.1小修复,更新内容超80条。有Skills自动热重载等新功能、大量bug修复及体验优化。作者建议大家升级,认为它想做完整开发环境。
Dia 没死,人家转手就发了 1.x 版本
OpenAI 发布浏览器 Atlas 引发讨论,有人认为其有缺陷会失败,也有人觉得初创 AI 浏览器会被巨头收割。以 Dia 为例,它被收购后加快迭代,推出 Skills Gallery、Research 等功能,还新增连接 App 等特性。
重塑你的vlog!PickStyle打造稳定的视频风格迁移模型
Pickford提出PickStyle,这是基于扩散模型的视频到视频风格迁移框架。它结合上下文–风格适配器和CS–CFG机制,能在保持画面连贯时准确迁移风格,还能避免闪烁等问题,不过也继承了基础模型部分缺陷。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。