「可视化交互」共找到 707 篇相关文章
94.5K Star!2026现象级开源 AI Agent,Moltbot(原Clawdbot)+飞书保姆级安装教程!
2026年现象级开源Agent工具Clawdbot改名Moltbot,获94.5K Star。它能接管本地设备,可通过飞书交互。文章给出Moltbot搭建教程,包括准备工作、部署步骤和接入飞书机器人方法。
实时语音翻译
Sokuji 是跨平台桌面应用,用 OpenAI、Google Gemini 等 API 提供实时语音翻译。支持多系统,有桌面版和浏览器插件,适配会议场景,还具备音频可视化、虚拟音频设备等特色功能。
首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒
新加坡国立大学等联合发布EgoTwin框架,首次实现第一视角视频与人体动作联合生成,攻克视角-动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决难题,实验性能超基线。
Nano Banana核心团队:图像生成质量几乎到顶了,下一步是让模型读懂用户的intention
这是对Nano Banana核心团队的专访。团队认为图像生成质量提升空间有限,未来关键在模型可表达性和读懂用户意图。还探讨了图像模型发展趋势、应用场景、产品设计、评估方式等,提及与传统工具将长期共存。
冲上 GitHub 热榜,这个智能问数开源项目火了!
数据使用麻烦,存在“数据鸿沟”。开源项目SQLBot基于LLM和RAG技术,能用大白话查询数据库,将问题转成SQL执行并可视化呈现结果,功能实用,部署简单,降低了数据分析门槛。
华为发布如何利用RL训练强大的Deep Research Agent综述!
华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。
离谱,偶然发现一个逆天MCP...
作者偶然发现滴滴入局打车MCP,用其接入苹果打造能通过Siri用嘴打车的Agent。介绍了将滴滴MCP接入Claude Code、Fastgpt、n8n等工具的过程,还分享用Siri实现嘴打车的流程,认为其填补AI打车空白。
谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”
谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。
企业数字化转型新引擎:MCP + LLM + Agent 架构赋能!
本文介绍MCP(Model Context Protocol)模型上下文协议,它是Anthropic于2024年11月底推出的开放标准,可统一大模型与外部数据源和工具通信协议,打破数据孤岛,有诸多优势,还适用于多个场景。
SIGGRAPH 2025最佳论文出炉,清华、上科大、厦大获奖!谷歌拿下两篇
SIGGRAPH 2025技术论文奖项揭晓,投稿量首破970篇。5篇最佳论文涉及3D重建、图像个性化等前沿方向,清华、厦大、上科大均有入选,还有荣誉提名论文和时间检验奖论文公布。