「四层记忆架构」共找到 2300 篇相关文章
开源端到端语音大模型:直接从原始音频输入,生成语音输出
目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。
从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态
本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。
人生教练团Agent v2.0!给你省下万元咨询费(内有详细教程)
作者打造“人生教练Agent 2.0”,将马斯克、查理·芒格等大神“塞进”电脑。它有AI主持人,能根据问题召集合适导师。还介绍使用流程,灵感源于AIasMe等,后续会教加记忆功能。
全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压
港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。
极客说|AI Sales Avatar 探索
本文介绍名品车AI数字导购Vendy搭建过程,以TEN平台为中枢,集成Agora、Azure等五大平台,构建具备听、说、想、演能力的AI数字销售助理,还给出后续扩展建议,推动企业AI转型升级。
Veo 3全网实测惊艳所有人!DeepMind CTO:规模是AGI全部吗?
谷歌推出视频生成模型Veo 3,一句提示词就能打造电影质感短片,还能音画同步,引发网友惊叹。DeepMind CTO在访谈中表示,规模非AGI唯一要素,还提及Deep Think模式及Veo 3进展等。
炸裂!微软开源Windows子系统
今天凌晨微软宣布开源适用于Linux的Windows子系统WSL。它能让开发者在Windows上运行Linux环境,无需虚拟机或双引导。还介绍了WSL工具、架构及文件共享机制,回顾其发展历程。
完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!
Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为中小企业提供可控AI方案。
梅涛的视频AI创业,最新产品来了
本文来自量子位,对梅涛旗下智象未来发布的AI视频创作智能体Vivago R1进行深度实测,介绍产品定位、技术架构,分析AI视频赛道分化路线,分享实测体验,探讨AI创作工具发展方向。