「流式意图检测」共找到 328 篇相关文章
微软又上大分!刚刚开源一款 0.5B 轻量级实时 TTS 模型,还能边想边说!
2025 年大家致力于解决 AI「嘴巴」问题,追求实时流式对话。微软刚开源轻量级 TTS 模型 VibeVoice-Realtime - 0.5B,参数虽小但能边输入边朗读,有诸多特点和广泛应用场景。
Gemini 3来了,Software 3.0也快了
作者认为Gemini 3是目前最好的模型,编程时前端用Gemini 3,后端用Codex。无编程需求时,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。
250份文档投毒,一举攻陷万亿LLM!Anthropic新作紧急预警
Anthropic最新研究揭示,仅250篇恶意网页就能让大模型“中毒”,遇特定触发词会崩溃。研究还设计DoS型后门攻击,验证不同规模模型攻击效果。同时指出AI开放性易被操控,而Anthropic注重安全,有“防爆层思维”。
刚刚,Claude Code推出自动安全审查功能,顺便干掉了10家安全创业
Claude Code推出自动化安全审查功能,有 `/security-review` 命令和GitHub Actions集成两大核心能力,能检测多种漏洞,与传统SAST工具比优势明显,还能解释问题并提供修复建议。
开源模型竟被用于窃取下游微调数据?清华团队揭秘开源微调范式新型隐藏安全风险
清华、墨尔本大学团队研究指出,基于开源模型微调专有模型存在新型隐藏安全风险,开源模型发布者可埋后门窃取下游微调数据,新风险难检测、危害大,目前攻防方法待改进。
预测误差仅0.26mm,中科院自动化所×灵宝CASBOT团队让机器人提前“知道你要干嘛”
中科院自动化所与灵宝CASBOT提出DTRT方法获ICRA 2025录用。该方法利用Transformer和博弈论,将人类动态纳入长期预测,实验显示其预测精度和协作表现显著优于现有技术,有巨大应用潜力。
首发限时免费两周!实测腾讯混元Hy3:Agent能力飞升,日常主力毫无压力
腾讯混元Hy3正式版发布,尺寸300B,在多领域表现亮眼,追平甚至超越大参数模型。作者用三个刁钻场景实测,Hy3在全栈开发、3D游戏开发、办公任务中表现出色,幻觉率低,达生产级标准。
京东广告大模型实战:GRAM 架构如何在 50ms 内完成生成式推荐?
流量红利见顶,广告营销转型遇挑战。京东张泽华在大会公开应对方案,介绍 GRAM 架构,实现意图与商品语义对齐,控制推理时延,解决冷启动等问题,还分享算法与知识工程实践。
迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路
多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。
童年的滚球兽「走进」现实?华为天才少年创业,全球首个虚实融合的实时交互视频模型来了
Xmax AI 推出全球首个虚实融合实时交互视频模型 X1,通过手机摄像头实现虚拟与现实融合。它有四大玩法,操作简单。但面临多技术挑战,Xmax AI 团队实力强,给出硬核技术方案,愿景是让 AI 融入生活。