模长感知」共找到 955 篇相关文章

产品应用7

B站下场自研AI配音!纯正美音版甄嬛传流出,再不用看小红书学英语了(Doge)

B站发布TTS型IndexTTS2,亮点是实现时控制时再现符合Prompt的情感特征,支持两种生成方式,经测试多项指标达SOTA。它由三核心块组成,还可能是代号H的AI创作工具一环。

量子位
新闻资讯7

Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死

AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增曲线待发现。

新智元
算法论文8

LLM时代的事件抽取:从静态任务到认知脚手架

此综述论文探讨LLM时代事件抽取价值,认为其未被削弱,应视为“认知脚手架”。它系统梳理任务分类、方法演进等,还提出六大未来研究方向,指向将其演化为智能感知与记忆层。

深度学习自然语言处理
7

并行扩散架构突破极限,实现5分钟AI视频生成,「叫板」OpenAI与谷歌?

近日,CraftStory 推出 Model 2.0 视频生成系统,凭借并行扩散架构破解视频时难题,可生成达五分钟视频。其由 OpenCV 创建者 Victor Erukhimov 创立,此次突破或为企业带来商业价值,还计划开发新型。

机器之心
开源动态8

开源共建重塑推理 Infra:从架构创新到生态协同,Mooncake的破局之路

型推理落地面临成本、吞吐、上下文“三角困境”。开源项目Mooncake以“计算存储解耦”为核心,通过PD分离等技术提供底层支撑。直播邀请专家从多视角拆解其技术逻辑、开源价值与企业实践。

InfoQ
算法论文7

“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%

文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多态连接和跨页证据链接问题。

PaperAgent
新闻资讯8

AI有味觉了:分辨可乐和咖啡,只需“尝一尝”丨Nature

近日,科学家研发出基于石墨烯的人工味觉系统GO - ISMD,能拟人类味觉反应,感知酸、甜、苦、咸准确率达90%,还能分辨可乐和咖啡,相关研究登《Nature》官网,有望助神经疾病患者重获味觉。

量子位
产品应用7

怎么回事?刚被OpenAI收购,Windsurf就发了个自己的

5月初,刚被OpenAI收购的Windsurf发布AI编程型SWE - 1,该型针对软件工程全流程,核心是流动感知,实现人机自然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。

Founder Park
推荐文章8

Agent 任务如何不崩盘:Claude Code 上下文管理机制深度拆解。

文章深度拆解Claude Code上下文管理机制,包括七类上下文、预算与告警、加载、卸载机制等。指出其是分层缓存与多级预算管理系统,还为任务Agent开发者提供了管理启示。

AI大模型应用实践
算法论文8

博士学位答辩PPT分享 | Scalable Operation-aware Aerodynamic Design

杨奥博博士毕业于香港科大,期研究多学科优化方法在飞行器等设计中的应用。其博士论文提出可扩展的、基于任务感知的气动设计框架,贯通关键环节,形成一体化方法体系,有多项创新成果。

力学与人工智能