「Web 应用框架」共找到 3637 篇相关文章
大模型听懂语音却反而变笨?港中深与微软联合解决语音大模型降智问题
从GPT - 4o开启全能交互时代后,Speech LLM面临“模态推理鸿沟”问题,输入从文本变语音,推理能力显著衰退。港中深与微软联合提出TARS框架,通过三项创新解决此问题,实验显示推理能力100%复原。
MV导演诞生!上海巨人网络用让AI听懂音乐并掌镜拍摄MV
上海巨人网络AI实验室提出YingVideo - MV框架,结合音乐语义分析、镜头规划与视频生成模型,解决传统音频驱动视频生成难题。它分两步生成视频,以MV导演模块统筹,还解决长视频连贯性等问题,性能优于同类模型。
Gemini 3.0还在预热,中国AI抢先!30秒造APP全网首测
谷歌Gemini 3.0预热时,国内新生AI神器蚂蚁灵光上线。它能30秒造APP,实现“生成涌现”落地,以闪应用开启范式革命,用信息美学融合全模态,探索“摄像头+AI”新形态,让普通人提前感受未来AI世界。
云计算“活教科书”语出惊人,指明程序员的进化方向
亚马逊云科技副总裁Jeff Barr被称云计算“活教科书”。他认为AI编程工具放大开发者技能,开发者应提升沟通能力,未来“短命应用”将涌现,云与AI结合是趋势,还见证了中国云计算发展的巨大进步。
为何底层数据湖决定了 AI Agent 的上限?
随着 AI 落地企业进程加快,数据类型更丰富,传统企业级数据架构面临瓶颈。火山引擎构建多模态数据湖,以 Lance 为湖格式,从多维度选型技术,解决存储等问题,在多行业有应用潜力。
炸裂提速30倍!Meta提出REFRAF,无需改动模型,让RAG告别冗余与等待
近年来,RAG任务在提升模型回答质量的同时带来性能代价,Meta等团队合作提出REFRAG框架。它将无关段落压缩,引入强化学习选关键段落,实现高达30.85倍的TTFT加速,且无需改模型结构,实用性强。
专治智能体盲跑!微软发布AI Agent 5大可观测性,打通任督二脉
今天凌晨微软官网发布AI Agent 5大可观测性最佳实践,解决智能体盲跑等难题。介绍了智能体可观测性概念和好处,展示5个应用案例,还阐述5大实践,如选模型、持续评估、集成CI/CD等。
MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞
当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。
谷歌将 A2A 捐赠给 Linux 基金会,但代码实现还得靠开发者自己?!
当地时间 6 月 23 日,Linux 基金会宣布与多公司成立 A2A 项目,由谷歌捐赠协议规范等。A2A 支持智能体通信协作,谷歌称其将在中立治理下开发普及。此外还对比了 A2A 与 MCP、ACP 等协议,探讨实际应用问题。
微信自研高性能推理计算引擎 XNet-DNN:跨平台 GPU 部署大语言模型及优化实践
本文深入解析微信自研的高性能推理计算引擎 XNet-DNN,介绍其核心技术架构和性能优化策略。该引擎基于 RCI 框架构建跨平台 GPU LLM 推理能力,在多方面超越现有解决方案,还给出了详实对比实验数据。