视频评估」共找到 1659 篇相关文章

算法论文8

迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路

多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。

AI科技评论
新闻资讯8

高盛怕了!Claude Mythos全球首个攻破企业网络,奥本海默时刻来了

英国AI安全研究所研究显示,Anthropic发布的Claude Mythos Preview模型在网络安全评估中表现惊人,能全自动、全自主完成企业网络攻击模拟。高盛为此加强网络防御,人类网络安全或进入奥本海默时刻。

新智元
产品应用8

全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画

复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。

AIGC开放社区
开源动态7

警惕!“养龙虾”风险,一键给你的Openclaw做安全体检

OpenClaw在短时间内登顶GitHub开源榜首,国内企业纷纷部署。但它存在安全隐患,如漏洞、隐私风险等。朱雀实验室联合腾讯云EdgeOne推出「OpenClaw安全体检」功能,可自动完成全面体检与风险评估

腾讯技术工程
算法论文7

谷歌研究院探索多智能体协调的扩展原则

谷歌研究院对180种智能体配置对照评估,得出‘AI智能体系统首批定量扩展原则’。发现多智能体协同效果因任务而异,还指出工具使用瓶颈等问题,且开发预测模型辅助架构选择。

InfoQ
算法论文8

YC总裁转发、登顶Hacker News:SkillsBench揭开Agent技能扩展的残酷真相

近日论文《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》引发海外AI社区关注。研究聚合47150个Skills,经严格筛选评估,揭示人工构建Skills效果好、AI自生成无效等核心发现,为AI研发指明路径。

机器之心
开源动态7

AI用3年时光,来了解你!首个AI Clone长期记忆基准

现有AI记忆评测存在数据源单一、忽视变化本质、注入成本高等局限。开源学术社区QuantaAlpha联合高校团队提出CloneMem基准测试,构建合成人生,设计评测任务,实验发现简单方法在检索上更有效,记忆系统应还原信息。

新智元
新闻资讯7

最新 Anthropic 人类经济指数报告:AI 如何重塑经济?

Anthropic 持续监测 AI 实际使用情况,在第四份报告提出「经济基本要素」概念,分析2025年11月对话样本,探讨AI提效、任务时长、不同国家应用差异等,还评估职业受影响情况及对经济的总体影响。

特工宇宙
产品应用8

老黄挤爆牙膏!DLSS 4.5狂飙6倍,RTX 50系直接封神

2026年CES大会上,英伟达发布DLSS 4.5提升画质与帧生成,RTX Remix助力经典游戏重生,还将NPC变智能伙伴。同时,其软件升级利好AI PC,提升性能、减少显存消耗,让它更接近日常使用。

新智元
算法论文8

硅基大脑记忆觉醒!会遗忘、会反思、会成长的AI正在到来

哈尔滨工业大学等机构团队发表研究,用认知神经科学视角审视AI记忆系统,探讨如何让AI产生“自我”,构建会遗忘、反思、成长的记忆大脑,还涉及记忆分类、存储、管理、评估、防御及未来演进等内容。

AIGC开放社区