可动物体生成」共找到 5509 篇相关文章

开源动态8

顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤

UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。

AINLPer
产品应用7

告别「手搓Prompt」,前美团高管创业,要让物理世界直接成为AI提示词

在2025年AI硬件赛道火热背景下,Looki创始人孙洋团队打造Looki L1穿戴设备,将自动驾驶逻辑用于生活场景,转化视听信号为模型上下文,构建用户专属数据飞轮,让AI实现主动共鸣。

机器之心
开源动态8

离GPT-5最近的一次!中国1万亿参数开源巨兽突然爆火

月之暗面发布全新模型Kimi K2 Thinking,自称开源「思考Agent模型」。它参数约1万亿,性能亮眼,碾压GPT - 5等,能连续调200 - 300次工具,已上线并开源API和权重,开发者试用。

新智元
新闻资讯8

陶哲轩联手GPT-5,1小时攻克数学难题!全程无需编码,OpenAI副总惊呼

陶哲轩联手ChatGPT攻克MathOverflow复杂数学题,节省数小时编码时间。他先让ChatGPT生成代码,后改用分步对话找参数,还验证结果。AI助其发现错误、优化流程,凸显在数学研究的潜力。

新智元
推荐文章7

一文讲清三种AI应用系统的架构及及TOP威胁框架

文章从AI系统分类及架构出发,分析不同类型AI系统的威胁特征,并介绍现有的威胁分析框架。目前AI应用架构经历从GenAI到AI Agents,再到Agentic AI的演进,各方向独立发展,且威胁各有特点又有重合。

AI与安全
开源动态8

国产LLM大爆发的一周,Hugging Face热榜被承包了!

这一周国产开源LLM集中爆发,GLM - 4.5、Qwen3的5连发、Step3等接连发布。GLM - 4.5是新一代开源SOTA模型;Qwen3各版本在不同能力上提升显著;Step3是多模态推理模型;腾讯还发布了混元3D世界模型1.0。

PaperAgent
新闻资讯7

Cloudflare 发布公开测试版 Containers

Cloudflare宣布新的Containers服务发布公开测试版,让开发者在其全球网络运行容器。该服务与Workers深度集成,能运行资源密集型应用等。虽有功能受限,但Reddit反馈积极,后续还有改进计划。

InfoQ
算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention

高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,2倍加速推理且不损画质。

机器之心
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力长在管道上。

CourseAI
新闻资讯8

ChatGPT语音杀入桌面!你负责动嘴,一群AI负责干活

近日OpenAI将ChatGPT语音功能正式引入桌面版,其底层是新一代语音模型GPT - Live。大佬们看好语音输入,因其能高带宽传递上下文。该功能不仅能闲聊,还调度智能体,OpenAI想让ChatGPT成AI工作操作系统。

新智元