「文本规划」共找到 806 篇相关文章
首次!世界模型、动作模型融合,全自回归模型WorldVLA来了
阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。
开源端到端语音大模型:直接从原始音频输入,生成语音输出
目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。
我在哪?要去哪?要怎么去?字节跳动提出Astra双模型架构助力机器人自由导航
当今机器人导航系统在复杂室内环境面临挑战,字节跳动研发创新双模型架构Astra,含Astra - Global与Astra - Local子模型。经实验验证其性能佳,未来有广阔应用前景,但也存在需改进之处。
AutoDev Remote 编程智能体:你何必只让 AI 在白天分析需求、设计方案
AutoDev Remote Agent 作为 AutoDev Workbench 一部分进入试运行,可运行在服务器,辅助项目分析规划、编写代码等。它是开源方案,代码可自由发布修改,还介绍了选择它而非 IDE 的原因及未来计划。
这个开源模型的UI审美碉堡了~
当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。
扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反
北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。
腾讯Kuikly框架鸿蒙版正式开源 —— 揭秘卓越性能适配之旅
腾讯将广泛使用的跨端开发框架Kuikly鸿蒙版正式开源,已接入多款业务。它有高性能、动态化特点,适配中解决渲染、文本性能等问题,还优化调试效率,发布Compose DSL Beta版。
刚刚,Claude偷偷上线隐形水印,每个字都可全球追踪!
8月2日起,Claude生成文字将带隐形水印,触发原因是欧盟AI法案透明度要求。Anthropic设计了文本隐写加文件签章两层标记,覆盖五条产品线,全球生效,但水印存在四重局限,引发用户争议。
全球第一! 中国模型登顶榜首,首个可编辑AI语音来了
中国AI语音ViiTorVoice登顶全球语音权威评测榜单Seed - TTS,首创「局部编辑」能力,解决语音无法局部编辑痛点。实测效果惊艳,还具备精准情绪控制、无参考文本克隆等能力,部分模型已开源。