「扩散生成技术」共找到 4765 篇相关文章
蚂蚁专用模型超越o3!仅用2K训练样本刷新医疗AI榜单纪录
蚂蚁集团联合团队发布《MedResearcher-R1: Expert-Level Medical Deep Researcher》报告,其医学AI智能体MedResearcher-R1用2100条训练样本在医疗基准测试反超通用大模型,靠数据、工具、训练方法三大创新实现突破。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
如何用 AI 做营销:问题不是如何提效,而是底层打法变了
Olivia Borsje 认为 AI 重构营销行业,从工作边界、内容产出和策略方面带来变化。她总结的「AI Playbook」梳理营销 10 个核心问题,对比传统与新做法,还给出各环节实用建议。
AI Coding大佬聊透了:产品智能重要还是用户体验重要?答案让人意外
量子位举办AI Coding沙龙,百度、硅心科技等多位行业玩家参与。探讨AI编程从替代人转向协作、智能体发展、To B与To C界限模糊等话题,指出未来产品智能更重要,编程产品将服务更广人群,程序员技能需转变。
6秒造一个「视频博主」,Pika让一切图片开口说话
8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。
让AI读懂「言外之意」:AI4SG团队发布首个心理健康污名语料库,破解隐性偏见识别难题
心理健康患者常面临社会偏见,且这种污名化隐蔽难识别。新加坡国立大学AI4SG团队联合多学科专家,构建首个心理健康污名访谈语料库MHStigmaInterview,获ACL 2025认可,为解决该社会问题提供技术支持。
北航LiveRepoReflection: 扭转乾坤-仓库级代码反射
本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。
一句话复刻谷歌!我用智谱新开源的GLM-4.5,把Agent开发打回了简单模式。
智谱AI深夜发布开源的新一代旗舰模型GLM - 4.5,目标成为最强Agent基座。它能一句话复刻搜索引擎,多能力原生融合,在多项测试中表现出色,推理快、价格低,还通过多关压力测试,且开源成本低。
一个月重写三次代码库、三个月就换套写法!吴恩达:AI创业拼的是速度,代码不重要
吴恩达在 Y Combinator 演讲分享创业心得,指出执行速度是创业成败关键,创业者最大机会在应用层,介绍提速方法,还回应 AGI 炒作、token 成本等问题。
DeepMind夺得IMO官方「唯一」金牌,却成为OpenAI大型社死现场
谷歌DeepMind宣布其Gemini进阶版模型在IMO竞赛达金牌水平,解决五道超高难度试题,首次证明AI仅靠自然语言理解就能攻克复杂数学难题。其谨慎发布方式获赞誉,与OpenAI形成鲜明对比。