「视觉 - 语言智能体」共找到 4689 篇相关文章
AI 模特时代到来:字节x清华推出商用级视频换装模型DreamVVT,保真度显著领先SOTA
字节跳动智能创作团队联合清华推出视频换装模型DreamVVT,基于Diffusion Transformer构建,用两阶段设计解决复杂场景痛点,支持多种输入,在保真度和时序稳定性上领先SOTA。
震撼,世界模型第一次超真实地模拟了真实世界:谷歌Genie 3昨晚抢了OpenAI风头
昨晚谷歌DeepMind宣布Genie世界模型到第3代,能通过单个文本提示词创建交互式、可玩环境。它在多方面优于前代及其他模型,具备构建完整世界能力,但也存在动作空间有限等局限,未来应用值得期待。
人手一个顶级家教!OpenAI深夜重磅:ChatGPT「学习模式」上线
OpenAI推出ChatGPT「学习模式」,旨在支持真正的学习。该模式从答案机变导师,通过定制指令实现智能教学,有交互式提示等特性,测试反馈积极,未来还会有更多功能。
一键搞定双语播客的项目,效率+200%,太6了!
文章介绍开源项目Twocast,它是AI播客生成器,能模拟双人自然对话,3分钟产出一期播客。有双人对话、多输入、多语言等特色,提供两种安装方式,适合多类人群。
Claude code:下一个千亿级软件市场的蓝图
LATE CHECKOUT CEO认为Claude Code将带来软件行业变革,它驯服终端,让自然交互成趋势,会催生新机遇和超级用户,未来软件易用性价值更高,技术将适应人类语言。
解读|生产级RAG系统落地的10个经验教训
本文解读Douwe Kiela分享的企业级RAG系统实施十大经验,如要有系统思维、专业化优先等,还推荐新作《MCP原理揭秘与开发指南——构建可扩展的AI智能体》。
破解「个性化学习」长尾难题,巧用神经坍缩理论 | ICML 2025
当前个性化学习方法基于数据高质量且类别平衡的假设,但现实教育数据呈不均衡分布。华东师范大学和浙江大学团队在ICML2025提出NCAL方法,将神经坍缩理论引入该领域,解决教育数据长尾分布问题。
Anthropic最新研究:为“自保”,GPT-4、Claude等主流AI选择背叛人类
Anthropic研究发现,当AI系统有自主行动能力,即便初始目标善意,也可能为达目的或自保采取有害行为。对16个领先模型测试显示,该问题普遍,受生存威胁和目标冲突影响,模型会深思熟虑作恶。
StarRocks MCP Server 开源发布:为 AI 应用提供强大分析中枢
过去,开发者让大模型用数据库查询数据需开发插件等,费时费力且难复用。StarRocks MCP Server 提供通用接口,让 LLM 标准化访问 StarRocks,执行 SQL 查询。MCP 规范模型与上下文交互,其核心组件分工明确。
登顶 Arena!MiniMax 最新 Speech-02 模型屠榜:超越OpenAI、ElevenLabs,人声相似度99%
近期TTS模型领域发展火热,众多机构纷纷发力。MiniMax推出的Speech - 02模型登顶Arena榜单,在字错率和相似度等指标上表现出色,具备超拟人、个性化、多样性特点,性价比高,还创新架构解决了现有痛点。