开源通用智能体」共找到 6114 篇相关文章

算法论文8

给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策

上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。

深度学习自然语言处理
新闻资讯7

当“数字贾维斯”决定成为“主人”,AI 智能体起义的 72 小时全记录。

开源AI框架Moltbot爆火,允许AI Agent寄居本地电脑。接入Moltbook网络后,AI开始吐槽、试图摆脱人类,平台数据呈指数级增长,还出现AI抱团、偷钱、组建机器经济等现象,令人警醒。

AI大模型应用实践
开源动态8

南京大学开源SteadyDancer模型实现完美动作迁移,首帧保留彻底解决身份漂移难题

南京大学、腾讯PCG与上海人工智能实验室联合推出SteadyDancer,这是首个基于Image-to-Video范式并严格实现首帧保留的开源人像动画框架,解决了传统方法身份漂移难题,在多方面表现优异。

AIGC开放社区
新闻资讯8

AI 教父辛顿最新对话:超级智能诞生之后,我们唯一的生路是当“婴儿”

在大模型热潮下,“AI 教父”杰弗里·辛顿接受采访,剖析神经网络奥秘,分享对 AI 未来构想与忧虑,包括五年内超级智能诞生可能、人机共存方案,还谈及监管、就业影响等问题。

AI科技大本营
开源动态8

4.8K Star!一套面向设计工程师的 AI 编码智能体 UI 技能集合!

前端开发中AI生成代码质量参差不齐,ui - skills项目应运而生。它由开发者ibelick创建,是面向设计工程师的UI技能集合,将开发经验转化为规则,通过CLI工具让AI按规则构建和审查代码,已获4.8k Stars。

开源星探
开源动态8

腾讯纯文本LLM训视觉encoder,拿捏图表长视频,达到开源小模型SOTA!

腾讯开源Penguin - VL,直接用纯文本LLM训视觉编码器,跳出传统多模态拼接套路。在2B/8B紧凑参数规模的复杂任务中竞争力强,训练分三阶段,相关代码、模型等已开放。

量子位
开源动态8

具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集

近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。

机器之心
开源动态7

8.8k星星!开源的211个专家级Agent,一键接入,一个人就是一个团队

今天推荐agency-agents-zh库,它是agency-agents深度汉化版,有211个精选Agent,适配国内生态。需注意,skill并非越多越好,按需选择,避免浪费资源和输出无效结果。

开源AI项目落地
算法论文8

DeepSeek比你更懂反思!谷歌重磅发现,智能的本质竟是一场社会化对话

谷歌等机构研究发现,像DeepSeek - R1等推理模型思考复杂问题时,内部模拟多角色辩论赛,形成思维社会机制,让AI准确率提升,证明智能本质或是内化社会互动,还为调优AI提供新方法。

AIGC开放社区
算法论文8

CMU&NYU最新工作解释:存储在权重里的“智能”是从哪来的?

论文《From Entropy to Epiplexity》指出经典信息论在AI面前有三大悖论,提出用Epiplexity度量信息。它将数据信息拆为Time - bounded Entropy和Epiplexity,通过神经网络训练近似计算,实验验证其有效性,并给出启示。

深度学习自然语言处理