测试时深思」共找到 2277 篇相关文章

推荐文章7

为什么只有人类雌性有月经?

月经并非人类独有,但极其罕见。人类进化出侵入性强的血绒毛膜胎盘,子宫需自发性脱膜化做准备。因母胎冲突,内膜有防御筛选机制,没受精卵着床内膜只能出血脱落,即月经。

昆明走进自然户外
新闻资讯7

Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫

沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。

新智元
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
开源动态7

DragonMemory:16倍语义压缩,为RAG应用瘦身

介绍GitHub项目DragonMemory,它针对RAG应用上下文压缩,核心是Dragon v7模型,从序列维度压缩,压缩比达16倍。本地测试效果好,有图形界面,支持多格式文档,开源但非成熟商业产品。

AI工程化
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
算法论文8

推理与操控能力双提升!具身机器人双系统VLA模型新突破

香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。

量子位
开源动态8

性能飙升42%!人大&字节开源10万级 SWE数据集 Scale-SWE

近期,人大和字节开源10万级软件工程数据集Scale - SWE,用首创工作流从GitHub构建真实数据。基于此微调的Qwen3 - 30A3B - Instruct模型测试表现佳,其数据相比合成数据优势明显。

PaperAgent
开源动态8

中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026

北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。

AI前线
新闻资讯8

别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师

斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。

量子位
产品应用8

阿里「快乐小马」来了,首批网友已玩疯!720P低至0.44元/秒

今天,阿里HappyHorse - 1.0开启灰度测试。它有电影级叙事质感,指令遵循能力强,能驾驭多种风格,还可一句话改视频。性价比高,720P低至0.44元/秒,让AI视频从‘玩具’变‘工具’。

新智元