「多模态数字人」共找到 2201 篇相关文章
视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出图仅需4秒
谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出图快且便宜。二者串联使用,图像生成与视频创作可无缝衔接。
Legora、Mercor 都在用,Reducto 能成为独立的 LLM 数据入口吗?
当前企业AI落地瓶颈在数据质量,Reducto聚焦数据准确性,以文档解析API提供Agentic OCR能力。它获多轮融资,估值达6亿美元,但面临多模态模型竞争及定价等问题,其未来走向待察。
GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态。
OpenClaw 和 Claude Code 的本质分歧
文章对比了OpenClaw和Claude Code的差异。Claude Code是人本位,在终端运行,适合开发者;OpenClaw是AI本位,在聊天软件里使用,适合非开发者。两者代表AI Agent两条进化路线,各有优势。
今天起,GPT Image 2要把全体设计师送走了
GPT Image 2横空出世,暴打Nano Banana 2,其超强文字渲染和设计能力颠覆众多行业。它生成的图片真假难辨,解决文字渲染难题,降低数字内容生成成本,让设计师面临失业危机,也使互联网信任体系洗牌。
罗福莉C位亮相小米,离职DeepSeek后首次官宣
罗福莉今日官宣加入小米任MiMo团队负责人。此前就有她被雷军高薪挖到小米的传闻。她学术成果出色,曾在阿里达摩院、DeepSeek工作。小米MiMo剑指空间智能,与雷军的人、车、家全生态适配。
千问办公初体验:“三合一”更好用吗?
作者体验阿里千问办公内测版,它是三合一AI产品Qwenwork。虽系统设计距Codex有差距,但整合优势对普通用户有意义,具备CLI化、生态打通、多模态、拓展生态等特点,不过还需打磨。
大模型低价趋势延续!智象未来姚霆:B端、C端界限模糊,API不够、逼出 “按结果付费”
InfoQ 采访智象未来联合创始人姚霆,探讨多模态大模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。
上海首场!一场专为女性设计的黑客松
上海将举办首场专为女性设计的黑客松「She Code Lab Hackathon」NO.C001,时间为2025年12月26 - 28日。活动约50 - 100人规模,由女性主导,核心是‘表达’与‘联结’,主题为‘利她技术’。
马斯克Grok的AI男友还在取名,开源版AI女友已经火了,还是3D的
前几天Grok推出‘智能伴侣’功能,马斯克在线征集男性Grok数字伴侣命名。网友Jackywine复刻出3D版开源AI女友‘Bella’,介绍了其工作流、愿景及规划的‘AI原生’演进路径。