「可交互音视频」共找到 5065 篇相关文章
国产算力Day 0适配,一人剧组时代到来,商汤Seko 2.0降本增效让AI短剧真正落地
商汤Seko 2.0率先实现创编一体与多剧集智能生成,通过一致性控制技术与国产算力适配,缩短漫剧制作周期。它解决了AI视频生成痛点,降低成本、提升效率,适配国产芯片,还拓展了内容生态。
打破幻觉!Qwen最新OCR让印章、表格、公式识别准确率飙升45%
基于推理增强框架的视觉语言模型处理OCR任务有成果,但存在生成幻觉问题,特定领域不如专家模型。DianJin - OCR - R1通过推理与工具交互,按‘思考 - 调用工具 - 重新思考’流程提升OCR性能,减少幻觉。
76%的性能提升与模型无关?Karpathy 700次 Loop 实验揭开 Agent 最大误区
前OpenAI联合创始人Andrej Karpathy警示业界重视模型框架。Hugging Face实验表明优化模型外层执行机制可大幅提升Agent性能,Karpathy开源项目揭示AI价值在循环迭代。还介绍了搭建持续进化Agent的方法及注意事项。
Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域
今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。
突发,马斯克xAI解散了!22万张GPU忍痛全给Claude
马斯克官宣解散xAI并入SpaceX,同时将全球最强超算Colossus 1租给Claude。此前xAI与OpenAI竞争不利,Grok表现不佳且亏损严重。马斯克此举类似谷歌策略,可赚钱、扶持对手、盘活资产,还在法庭起诉OpenAI。
Agent RL 总是训练崩?UCLA 这篇论文给了救命稻草!
这篇解读UCLA和威斯康星大学麦迪逊分校论文《ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning》的文章指出,Agent RL训练易崩溃,原因在于多轮交互任务带来奖励稀疏等问题。论文建“竞技场”,提出SAMPO算法提升稳定性,还给出从业者建议。
性能碾压GPT-4.1-mini!Mistral开源Devstral,还能在笔记本上跑
法国AI初创公司Mistral与All Hands AI合作,发布全新开源语言模型Devstral,有240亿参数,所需算力低,可本地部署。它能解决真实GitHub问题,在SWE基准测试中表现优于多个模型,还能通过API访问。
字节Seedance,正在占领好莱坞
字节Seedance从被好莱坞排斥到被认可,进入创作者圈与工作流,用于拍电影长片。它成本低且有免费福利,吸引独立电影人。在AI视频模型竞赛中逼近美国对手,影视业对AI投入将上涨。
小米AI语音新框架:人人都能当声音导演
小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。
独家发布 Qclaw 24 小时后,OPC 们涌入观猹,等一个邀请码
腾讯发布桌面 Agent 工具 QClaw 后热度飙升,逼近字节豆包。因其可通过微信调用,安装门槛低。观猹成 AI 产品冷启动首选平台,还衍生出龙虾到家服务,观猹员真实评价助产品迭代。