可交互音视频」共找到 5044 篇相关文章

算法论文7

AI 模拟消费者,预测购买意图准确率达 90%

PyMC Labs和高露洁棕榄团队研究发现,让大语言模型扮演消费者,用另一AI评分90%准确预测购买意图,还提出SSR方法。虽有优势,但也面临质疑和局限,增强市场调研。

AI工程化
产品应用7

大模型公司不搞浏览器搞Agent,实测找到原因了

文章实测阶跃星辰桌面Agent小跃,它能操作命令行,自然语言驱动计算机功能,有悬浮球形态,能联网、搜索、处理表格等,还支持复用操作、定时任务,但也存在速度慢等不足。

量子位
新闻资讯7

ChatGPT 要发“成人版”,将放松内容限制

网络吐槽ChatGPT机械保守,OpenAI CEO Sam Altman透露,未来几周将推新版本允许更人性化对话,12月成年用户访问含情色内容功能。此前限制过严,现技术改进放松限制,用户反应不一。

AI工程化
新闻资讯7

对话阶跃星辰段楠:“我们能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
产品应用8

Claude Science几周干完两年活,10倍科研提速真来了?

2026年6月30日,Anthropic发布Claude Science,定位面向科学家的AI工作台。它将科研拆成审计流水线,整合工具链,自带追溯代码,有协调与审查智能体,首落生命科学领域,与Google、OpenAI玩法不同。

新智元
开源动态8

Google Research 开源新架构,AI 不再依赖云端,直接跑在手表和耳机上

Google Research 开源 Coral NPU 平台,是面向硬件工程师与 AI 开发者的全栈开源方案,克服 AI 在穿戴和边缘设备落地的瓶颈,实现能耗与算力平衡,还能解决算力、生态、隐私等问题。

InfoQ
开源动态7

浏览器自动化:从GUI到OpenCLI

文章讲述放弃不稳定的前端UI自动化操作,采用解析并复现底层API请求的方式,来解决浏览器自动化的效率与稳定性难题。介绍了OpenCLI思路、使用方法、原理,还提及自动生成CLI及应用案例,指出未来软件竞争维度将转向调用性。

阿里云开发者
新闻资讯7

特斯拉下一代金色Optimus原型现身?一双「假手」成为最大槽点

Salesforce CEO发布与金色Optimus对话视频,盛赞其开启物理智能体革命。不过,其高昂价格、“假手”设计引争议。对比Figure机器人精准装碗视频,特斯拉Optimus表现不尽如人意,是否遇麻烦引人猜测。

机器之心
开源动态7

效果逼真到让人窒息!​开源Ctrl-Crash模拟车辆事故

近年来视频扩散技术在生成车辆碰撞真实场景时面临挑战,因驾驶数据集中事故样本稀缺。Mila团队提出Ctrl - Crash控碰撞视频生成模型,支持反事实场景生成,但也存在一些局限。

带你学AI
新闻资讯8

刚刚,OpenClaw和Cursor杀入手机!Agent从此塞进口袋

OpenClaw和Cursor同日发布原生App,OpenClaw上架全血原生App,无缝交互,解锁设备底层能力;Cursor发布iOS应用公开测试版,让开发者在手机上指挥代码开发,重塑人类工作方式。

新智元