传统软件测试」共找到 3159 篇相关文章

算法论文7

“看懂”指令并做动作!Motion-R1结合COT让角色动起来

大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。

带你学AI
算法论文7

一文解读 LLM Posting-Train技术

文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
新闻资讯7

AI可观测行平台Lightrun,获7000万美元

AI可观测性平台Lightrun获7000万美元B轮融资,由Accel和Insight Partners领投。它改变传统监测工具局限,实现实时调试修复。连续三季成G2领域领导者,获众多企业信赖,发展迅猛。

AIGC开放社区
新闻资讯8

广电绝地反击!揭秘多彩新媒「不烧钱」的AI生存法则

传统广电行业面临生存危机,多彩新媒依托1100万IPTV用户,规划‘技术筑基-场景落地-生态协同’转型路径。战略聚焦三核心,技术结合外部能力分层搭建体系,场景围绕三维度落地,生态强调内外联动。

机器之心
算法论文7

视频模型假装在推理?MME-CoF新基准评估12个推理维度

视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。

新智元
7

Sora2五天下载量破百万!超越ChatGPT增长速度,App Store免费榜霸榜第一

Sora2五天下载量破百万,增长速度超ChatGPT,在App Store免费榜霸榜第一。其虽有使用门槛,但热度高,盗版泛滥。不过它也面临版权问题,审核收紧。AI创意应用取代传统社交媒体速度加快。

量子位
推荐文章7

中国ToB软件公司想赚钱,先对AI Coding祛魅

文章指出AI Coding产品虽对专业开发者提效,但服务公民开发者时存在问题。对比‘Code + GenAI’与‘No Code + GenAI’,认为无代码平台更适配公民开发者,虽面临挑战,但短期内是企业软件定制最优解。

InfoQ
新闻资讯7

27、42、73,DeepSeek这些大模型竟都喜欢这些数!为什么?

技术作家发现GPT - 4o、Claude等模型猜数偏好42、73,Andrej Karpathy测试中模型多选27。网友猜测原因,如数据集、人类偏见等,也有论文分析此现象,多与数据分布有关。

机器之心
算法论文7

ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心

近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试

深度学习自然语言处理
算法论文8

超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发

斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在多基准测试中超越Claude Mythos和GPT - 5.5。

量子位