「文本到 3D 生成」共找到 4291 篇相关文章
高考第一天,用豆包修图3.0花式「整活」送祝福,已原地笑翻!
豆包的一句话P图功能进化,其图像编辑模型SeedEdit 3.0全量上线,AI修图进入3.0时代。用自然语言就能精准编辑图片,在文字编辑、局部修改等方面表现出色,还突破以往模型瓶颈,成设计师利器。
狂涨 9.1K star!最近这款谷歌的AI开源应用,超级火!
介绍Google的实验性应用`Google AI Edge Gallery`,它将生成式AI模型嵌入手机,支持Android和iOS,可离线运行,有多种实用功能,在Github获9.1K star,虽处Alpha阶段但潜力大。
马斯克公布SpaceX火星新计划,迈向多行星生命之路!
马斯克在德州Starbase公布SpaceX火星最新计划,介绍从Starbase发展、星舰生产目标、技术突破到火星城市建设等多方面内容,展示人类成多行星物种的清晰路线,还提及火星时间表等信息。
微软为 Windows 11 内置全新命令行编辑器 Edit,开源且轻巧
在 Build 2025 开发者大会上,微软发布全新开源命令行文本编辑器 Edit,将作为 Windows 11 内置组件。它轻巧且功能实用,但开发者对其必要性存疑,微软解释了自研考量,代码已开源。
低Token高精度!字节复旦推出自适应推理框架CAR
字节与复旦大学研究人员提出自适应推理框架CAR,能根据模型困惑度动态选短答或长推,在多基准测试中平衡了准确性与效率,打破长文本推理必然性能更好的认知。
生数科技按下B端商业化快进键:30天签约智谱、飞书等多家行业龙头|甲子光年
AI视频生成行业商业化加速,生数科技不到一周官宣与智谱、飞书等合作。其Vidu基座模型能力强,多领域开花,2025年Q1商业化增速快,还凭交付与服务能力获头部青睐。
毫秒响应延迟!开源统一语音对话模型Voila
Voila是开源统一语音对话模型,能以自发、实时且有情感的方式与人类互动。它采用全新端到端架构,响应延迟仅195毫秒,支持超百万种预构建声音,适用于多种语音应用。
给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理
针对原生视觉推理缺少完整训练评估基础设施的现状,NTU等多校联合推出VBVR-Pro系统,构建了从任务构建、模型训练、能力评测到强化学习优化的完整闭环,论文、数据、代码均已公开。
SGLang 的 DeepSeek-V4.1 Flash Day 0 优化实录:4×B300 上 BS=1 达到 764 tokens/s
本文是SGLang团队的DeepSeek-V4.1 Flash Day 0优化实录,详解了架构适配、KV cache压缩、kernel优化到DSpark适配全流程,公开4×B300 GPU实测吞吐数据,附复现代码与步骤
Claude一天3崩!API、App、Cowork全挂,打工人集体抓瞎
8月24日Claude一天崩三次,Anthropic状态页三次变红又宣布恢复,但用户仍打不开。故障从中午持续到下午,波及多个产品。8月故障频发,还存在算力枯竭、模型变笨等问题。