连续扩散语言模型」共找到 1396 篇相关文章

新闻资讯7

微软最新揭秘:「话痨实习生」AI助手,到底能帮人类做什么?

基于20万微软Copilot使用数据的研究指出,AI能支持研究、写作和沟通任务,但无法完全胜任单一职业所有任务。Copilot执行任务多为解释型,写作和信息收集任务满意度高,语言和创作类职业受影响大。

新智元
推荐文章7

涌现之谜:AI如何像人一样思考与表达?

文章探讨AI如何像人一样思考与表达。早期自然语言处理受通用语法理论影响,但面对真实语言复杂性存在困难。人类经历第一次认知革命实现思维转变,AI也需足够大规模才能涌现复杂能力,“大”或是智能第一性原理。

AIGC开放社区
开源动态8

阿里AI 重磅第4发:电影级MOE 视频模型Wan2.2正式开源!

阿里通义团队开源电影级视频生成模型Wan2.2,将光影、色彩、镜头语言装进模型,支持60多参数自由组合。它是业界首个用MoE架构的视频生成模型,推理省计算资源,性能超主流模型,获国外网友盛赞。

AGI Hunt
开源动态8

阿里开源电影级AI视频模型!MoE架构,5B版本消费级显卡可跑

阿里开源新一代视频生成模型通义万相Wan2.2,含文生视频等功能。它率先将MoE架构用于视频生成扩散模型,5B版本可在消费级显卡部署。对比前代和Sora表现更优,还推出电影级美学控制系统。

量子位
算法论文8

对噢!为什么LMs就不能直接输出答案+confidence呢?

当前语言模型在复杂问答任务中存在校准退化问题,本文提出RLCR方法,将概率校准融入RL训练目标,重构奖励函数,在多个数据集实验中显著降低校准误差,不损失准确性,为高风险场景AI部署奠基。

深度学习自然语言处理
算法论文8

极低成本,复现GPT-4o图像风格化一致性!NUS推出OmniConsistency

NUS ShowLab 推出 OmniConsistency,解决开源扩散模型在图像风格化一致性上与商业 API 的差距。它成本低,能在保持风格化效果时精准保留图像细节等,还解决了风格化与一致性的跷跷板问题,且兼容性强。

机器之心
推荐文章7

对话斯坦福终身教授徐升:我找到了可穿戴的“宝藏”

本文对话斯坦福终身教授徐升,他研究方向从基础材料转向柔性可穿戴超声。其团队成果包括可穿戴心脏超声成像贴片、连续胎儿血流监测贴片等。他认为可穿戴电子缺‘AlphaGo时刻’,还分享学术与创业经验。

DeepTech深科技
新闻资讯8

影身智能完成多轮融资,用原生3D数据重新定义机器人认知|甲子光年

影身智能已连续完成多轮融资,累计近亿元。其以‘原生3D动态世界模型’为核心技术,采用与市场不同的‘升维’思路,用自研的‘影身360’系统采集3D数据,还落地柔性智造行业,目标是打造通用人工智能产品。

甲子光年
推荐文章7

我们就这样在一起搞了两年

作者2024年离开特赛发后创业,用积蓄和炒股所得作为本钱。项目避开大语言模型和视频生成,选教育领域做考研调剂志愿填报,用agent完成工作。产品销售不错,作者虽有心理波动但坚持,未来想尝试新领域。

Agent的潜意识
开源动态8

告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆

当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。

PaperAgent