「多人对话视频生成」共找到 1525 篇相关文章
本周5个yyds的Github开源项目,速速收藏!
文章介绍本周5个Github优质开源项目。有基于云服务的CloudPaste,排版强的Quarkdown,视频下载工具Media Downloader,双语翻译插件FluentRead,还有全能安卓助手LinkAndroid,各有特色功能。
OpenAI深夜甩出GPT-5.1,称更热情,更智能!网友狂吐槽:我不想和它聊天,只想用它工作
OpenAI发布GPT-5.1,包括Instant和Thinking两个版本,称更智能、对话更愉快,还增加“个性/语气”选项。但网友质疑“强化个性”方向,想要高效工具而非“虚拟朋友”。
别难为 ChatGPT 了!面对海量资料,NotebookLM + Gemini 的“外挂模式”才是降维打击
Google打通NotebookLM和Gemini后,二者协作效果出色。NotebookLM可拆解复杂信息,Gemini以其为参考数据源答案更精准。二者还能基于笔记本做网站、视频、图片等,各有优势、双向协作。
Claude一夜吞掉所有APP,全球打工人变天!AI时代「操作系统」诞生
Anthropic官宣十大办公神器可在Claude中交互,集成「MCP Apps」打破AI与软件工具隔阂。Claude从单一对话助手向「AI工作站」演进,新功能已向部分用户开放,MCP Apps带来交互革命。
Meta全新AI组织架构曝光,这范儿有点字节
Meta内部组织调整后,全新架构浮出水面,围绕‘超级智能实验室’整合出3400多人的新组织,负责人是亚历山大·王。其分工类似字节AI架构,还在挖人,有反噬风险。
ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」
现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。
你永远叫不醒装睡的大模型!多轮对话全军覆没,性能暴跌39%
研究人员进行超20万次模拟实验,耗资5000美元,评估大模型在多轮对话中的表现。结果显示,大模型在多轮对话中性能明显低于单轮对话,平均下降39%,还出现“对话迷失”现象。
微软又上大分!刚刚开源一款 0.5B 轻量级实时 TTS 模型,还能边想边说!
2025 年大家致力于解决 AI「嘴巴」问题,追求实时流式对话。微软刚开源轻量级 TTS 模型 VibeVoice-Realtime - 0.5B,参数虽小但能边输入边朗读,有诸多特点和广泛应用场景。
ChatGPT 为什么越来越“懂你”?一文解析它背后的记忆机制
今年4月,OpenAI对ChatGPT记忆系统重磅升级,可参考过往对话提供个性化响应。软件工程师Eric Hayes拆解其双重记忆架构,推测实现机制,探索对用户体验的重塑。
Vibe Coding 继续:这次,AI Studio 让你可以“画着改UI”
谷歌在AI Studio中引入注释模式,可乱涂乱画用注释命令修改,能更自然地更改应用,与Gemini进行直观视觉对话,还提到Cursor等IDE中类似功能实现方式。