视频换装框架」共找到 2494 篇相关文章

新闻资讯8

这家 AI Lab 宣布所有模型无限期免费后,我顺手做了个图片版番茄钟

全球排名前十的 AI Lab,Agnes 宣布旗下核心全模态模型 API 无限期免费开放,包括文本、图片、视频。还新增百万 Token 上下文和 4K 图片生成功能。作者用其做了图片版番茄钟,官方也公开开发进度。

AGI Hunt
产品应用7

既要安全⼜要弹性,理想汽车如何解开企业 OpenClaw 落地死结|甲子光年

2025年以来,大模型应用飞速发展,以OpenClaw为代表的开源框架是变革催化剂,但其在企业级生产环境有缺陷。理想汽车以阿里云ACS Agent Sandbox及ACK为核心,为Agent构建专属‘沙箱’,解决落地难题。

甲子光年
推荐文章8

AI的窗口期还剩多久,不同窗口处于什么阶段?战略上车来得及吗

文章指出AI窗口期并非单一窗口,而是一组接力出现的窗口。分析了基础设施投资、AI人才、AI应用创业等五个维度的窗口期阶段,给出识别窗口期的框架,还为普通人抓住窗口期提供了实操策略。

AI Reading Hub
开源动态8

诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计

过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。

机器之心
新闻资讯8

Demo秀终结,机器人连干8小时不歇!智元定义「部署态」

4月17日智元合作伙伴大会上,智元创始人定义2026为「部署态」元年,即机器人在真实场景7×24小时自主干活。大会首提XYZ曲线产业发展框架,还发布七大生产力解决方案,展示四大新本体、六大AI模型等成果。

新智元
算法论文7

复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」

多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。

量子位
算法论文8

告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式

现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。

机器之心
研究论文7

Nature科学报告:对AI的焦虑,理科偏接受学习,文科偏批判回避

青海大学等团队在《Nature》科学报告发文,调查三所川校师生对AI的焦虑与采用意愿。研究构建新框架,整合三种AI焦虑,发现不同焦虑对技术接受影响不同,学科和自我效能也会调节转化路径。

AIGC开放社区
产品应用7

用户痛点发现器

用户痛点发现器是个Web应用,能从社交媒体自动发现用户核心痛点,支持聚类分析和AI产品方案生成。它可输入关键词抓取抖音视频和评论,用GLM-4.6模型分析,还有优先级评分等系统。

GitHubStore
开源动态7

Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU

对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。

AI工程化