「情感评估」共找到 796 篇相关文章
腾讯混元图像3.0开源榜一,工业级800亿参数可商用,附提示技巧
28日,腾讯开源800亿参数的工业级原生多模态生图模型HunyuanImage 3.0,个人和月活≤1亿公司可免费用。它是全球参数量最大、性能最好的开源图像生成模型,技术强、评估表现优,官方还整理了提示词手册。
1052篇文献!上海AI Lab发布科学LLM综述:从数据基础到Agent前沿
上海AI Lab主导,25家研究机构共同梳理270+训练集、190+评测集,提出科学数据分层框架与智能体闭环科研新范式。还介绍了模型演进、数据情况、评估基准等,指出数据缺陷并展望走向科学家智能体的三步。
企业落地 NL2SQL,需要的是 AI-ready data 和 小模型
当NL2SQL从Demo走向生产,关键是‘更干净的数据底座 + 更小的专用模型 + 更可控的工程化流程’。文章指出先数据后模型,小模型足够用且落地成本低,评估要换维度,还介绍了工程化路径等内容。
Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔
Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结了上榜的编码工具,如new.website胜率约73%排第一,还对比了不同类型模型的排名情况。
o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界
GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。
AI 陪伴赛道,会诞生下一个「泡泡玛特」吗? | GAIR Live
AI科技评论组织“AI陪伴”线上圆桌,多位从业者探讨AI陪伴是否伪命题、不同人群接受度、产品核心价值等,还讨论IP对AI硬件的重要性、硬件与软件优势、是否出海等问题。
大模型进入研发体系后,我们看到了这些变化
InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师探讨大模型入研发体系的变化。指出其在提效、协作、分工上作用大,还分析了适用场景、工程师收益类型及核心竞争力等,也提及效率评估、代码生成等问题。
扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反
北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。
「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?
4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。
具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023
本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。