「实时视频对话」共找到 1751 篇相关文章
2025值得一看的31件AIGC作品
2025年AIGC成连接历史与未来的‘文化转译器’。文章盘点MANA网站31件优秀AIGC作品,涵盖与各领域结合形式,呈现与历史对话、激活即时艺术等4大创作趋势,展现AIGC多元玩法。
2025-06 - 念头通达(月度小结)
作者 2025 年 6 月月度小结,称不再想读博、不追求研究工作,认为有让人幸福的工作。工作上 Agent 落地有收益,探讨平台化提效,还分享选业务的乐观心态,也提及消费和做视频情况。
一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线
Anthropic和牛津大学研究发现,大模型的AI助理角色易在长对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。
Runway重夺全球第一!1247分碾压谷歌Veo3,没有千亿算力也能干翻科技巨头
Runway Gen - 4.5击败谷歌Veo3,以1247的ELO分数在Artificial Analysis榜单中重夺AI视频王座。它在多方面树立新标杆,虽有局限,但创始人认为其是通用模拟引擎,应用场景广泛。
Nano Banana官方提示词来了,附完整代码示例
Nano banana正火爆全球,谷歌推出官方提示词指南。文中展示其强大效果,如人物合照、生成动画视频、换脸等,还总结其5大核心功能,给出6类提示词及代码示例。
The Batch: 931 | 统一视觉媒体的单一分词器
Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。
谷歌、OpenAI同日发布模型,一个最快最具性价比,一个主打「人情味」
深夜谷歌和OpenAI相继推出新版本大模型Gemini 3.1 Flash - Lite、GPT‑5.3 Instant。前者专为大规模智能设计,性价比高、速度快;后者让日常对话更稳定实用,减少幻觉,提升了多方面表现。
我用AI同传干掉了英语发布会,爽。
作者因听不懂英语发布会,借助豆包同传2.0 API自制AI同传工具。虽开发遇诸多难题,但最终用音频重定向解决。该工具能实时翻译,还可复刻音色,也肯定专业译员能力。
抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅
视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。