「开源情报」共找到 2970 篇相关文章
免费、开源!谷歌Gemini CLI彻底火了,平替Claude Code
谷歌开源的Gemini CLI火了,它能运行在终端,有谷歌Gemini Pro 2.5功能且基本免费。擅长编程等,与AI编码助手集成,有高免费额度,还具多项强大内置工具,或成Claude Code劲敌。
腾讯开源全新动作迁移模型FlexiAct,人物 & 动物都支持
当前动作定制方法在应对多样化主体和场景时适应性差,清华与腾讯提出FlexiAct模型。它引入RefAdapter和FAE,能在空间结构差异大或跨域场景中精准适配动作,保持外观一致,表现优于其他方法。
本地运行、支持视觉与工具调用:Meta 开源智能体模型
Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。
比 Playwright 更给力,这个新开源的项目6啊~
GitHub上的BrowserAct项目是面向AI Agent的浏览器自动化CLI,是为AI Agent设计的真实浏览器执行层。它有三层反检测突破体系、三种浏览器模式等功能,能解决Agent操作浏览器的诸多问题,适合多场景。
The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者
Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。
北大开源统一世界模型框架:多类合成推理任务一套搞定
世界模型研究中,不同任务存在接口不统一等问题。北大DCAI课题组联合多方推出OpenWorldLib推理框架,整合多模态能力,构建标准化接口体系,在多任务上评估效果良好,降低研发门槛。
Insanely Fast Whisper:开源社区让音频转录速度提升19倍
Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。
OpenAI 官方博客:用技能(Skills)加速开源项目维护
OpenAI用Codex改变维护OpenAI Agents SDK仓库方式,通过仓库本地技能、`AGENTS.md`文件和GitHub Actions,将工程工作变为可重复工作流,提升开发效率,还介绍了配置、技能架构及使用注意事项。
五百行代码打造SOTA视觉智能体!UniPat AI最新开源
多模态大模型代码能力强,但基础视觉任务常失误。UniPat AI推出极简视觉智能体框架SWE-Vision,让模型用代码弥补视觉短板,在五个主流视觉基准测试达最优。该框架设计独特,开源代码和数据已发布。
蚂蚁出手VLA,就是开源超越Pi0.5的基座模型
当前具身智能落地面临泛化能力不足的挑战,蚂蚁灵波开源发布的基座模型 LingBot-VLA 带来突破。它基于大量真实世界数据预训练,在多项真机任务测试中超越 Pi0.5,且在架构、效率等方面有创新。