「多场景支持」共找到 5963 篇相关文章
全新唇同步技术OmniSync,遮挡,侧脸不在话下
唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准。
当AI幻觉开始操作电脑:深大、港科大提出ECA,让Agent行动前先验证证据
本文针对Agent场景下AI幻觉会转化为实际错误操作的问题,介绍深圳大学与香港科技大学提出的ECA框架,通过独立验证加门控检查降低不安全执行风险,给出测试数据验证方案有效性。
李飞飞发布Atlas,世界模型进入新时代
李飞飞创业公司 World Labs 发布新一代世界模型 Atlas,它是全模态模型,能处理四模态数据。其核心为空间上下文设计,评测成绩不错,应用场景丰富,公司发展节奏密集,产品路径有转向。
The Batch: 964 | Claude 亮相另一款 Opus
Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。
爆改!8.1 万 Star LobeHub ,终于让我彻底解放啦!!!!!
LobeHub是开源的Agent工作与生活空间,GitHub约8.1万Star。它将Agent作为工作基本单位,解决了多Agent管理难题,有创建、协作、调度等功能,还介绍了工作流和自托管方法。
开源知识库,从 0 到上线,UltraRAG 企业知识库全流程实战 ,也许这是RAG最好的框架之一~~~
UltraRAG是基于MCP架构的轻量级RAG开发框架,核心设计工程友好。其3.0版强调推理可视化,适用于科研复现、企业知识库问答等场景,还介绍了使用方式,能解决RAG落地痛点。
Clawdbot火了,Anthropic急了,Claude Code连夜更新了Agent任务系统。
Claude Code更新Tasks系统,将原TODO系统升级,任务可借助文件系统持久化,实现进度同步。Task变为依赖图,有阻塞关系,还能让多个Agent分工协作,任务状态存本地文件,方便查看。
“交互式Scaling”:增加Agent与环境交互的深度和频率来提升性能
在AI发展中,商业研究Agent是“黑箱”,开源研究Agent性能有差距。MiroMind团队推出MiroThinker v1.0,提出“交互扩展”提升性能,在多基准测试表现出色,也指出了当前版本的局限。
硅谷热议:最快语音转文字模型
AI语音独角兽ElevenLabs发布Scribe v2 Realtime实时语音转文本模型,实现150毫秒超低延迟、93.5%高准确率,覆盖90多种语言,打破速度与精度不可兼得困境,此前该领域痛点多。
10万亿算力订单根本hold不住?Altman偷递11页“要钱申请”,还嘴硬 “不求联邦”,白宫直拒:谁都不救!
近日,OpenAI 就财务状况表态引发混乱,面临不诚实指控。首席财务官提议政府‘支持’公司基础设施贷款后又收回表述,白宫 AI 主管称不会救助。Altman 否认寻求担保,但公司信函细节与之冲突。