「模型行为团队」共找到 9409 篇相关文章
少 61% Token、多10倍成功率,这个终端 AI 编程代理火了!
现在多数AI编程工具问题多,而在Github上火爆的`oh-my-pi`是运行在终端的AI编程代理,有哈希锚定编辑等实用功能,支持多模型,经基准测试效果好,还能解决实际开发痛点。
指导Harness的越多,收益反而越差
Thinking Machines Lab的《Interaction Models》指出,当下产品形态中,指导harness越多收益越差。问题在协作带宽,提出把“会交互”练进模型本体,介绍了从零训练的interaction model及架构,还指出现有交互评测不足。
清华、西交联合开源发布了Cheers : 一条更简洁、更高效的统一多模态路线
清华、西交联合开源发布CHEERS,提出面向统一多模态理解与生成的架构路线,在保持系统简洁前提下,统一理解与生成任务,继承开源预训练模型知识,在多项基准测试中表现优异,还实现4× token压缩。
OpenClaw 火了半年,Agent 执行层依然是工程空白
当前主流 Agent 工具链执行层基本空白,Violoop 是少数在执行层做系统化设计的项目。它是桌边触屏硬件,获取三类运行时数据,具备感知 - 判断 - 执行运行时,有多种核心能力,适合特定场景团队评估。
不同灵巧手,终于可以共用「一套大脑」了
北卡罗来纳大学教堂山分校团队提出 One Hand to Rule Them All,构建统一描述空间,使不同灵巧手共享动作表达与策略结构。该方法解决跨手泛化难题,实验证明其在多方面有效,有望推动机器人操作研究发展。
1.2万人收藏单日斩获 3.4K!刚刚冲上 GitHub Trending 榜首的“AI 红队”工具!
AI加速代码编写,但也留下更多安全坑,传统扫描工具和人工渗透测试难以应对。新晋GitHub Trending榜首工具Shannon是全球首个开源全自动AI渗透测试员,多智能体架构,功能强大,适合AI编程团队。
Swift 跨平台框架 Skip 现已完全开源
Skip 是用 Swift/SwiftUI 代码库创建 iOS 和 Android 应用的方案,经三年开发后团队将其完全开源,此前为付费方案。开源既是因开发者希望免费获工具,也为保证工具持久性,它能实现原生体验。
DeepSeek-R1全升级V2版:Token成本低至原来30%
DeepSeek - R1 V2版全维度升级,训练框架从‘单一RL’到‘多阶段协同优化’,推理能力从‘能推理’到‘会优化推理’,还提升了安全可控性,适配生态,推出轻量级模型。
裁4000人换来的AI全白搞?Salesforce悄悄改架构:用 “老技术”故障少还省钱,网友怒喊:CEO零遣散费滚蛋
Salesforce曾大举部署AI并裁员,宣称Agentforce能降本。但如今高管称不过度依赖大模型时运行更好,已引入基础自动化技术。其应用遇瓶颈,故障频发、成本高,还面临AI“漂移”等问题。
苹果光速撤回RLAX论文:用了谷歌TPU和阿里Qwen,作者中还有庞若鸣
苹果一篇新论文在 arXiv 公开后匆匆撤稿。该论文揭示基于 TPU 的可扩展 RL 框架 RLAX,用了谷歌 TPU、亚马逊云及阿里 Qwen 模型,还介绍其架构、策略支持等,实验结果亮眼,也分享 Debug 过程。