「主观判断」共找到 245 篇相关文章
昇腾910B大模型实测:开源框架能不能打?真相全放这了
文章对昇腾 910B 大模型进行实测,对比 vLLM Ascend 与 MindIE 在实际推理场景中的性能差异。通过 GPUStack 平台测试多种模型,结果显示两者在不同部署场景各有优势,vLLM 适合单卡小模型,MindIE 适合大模型多卡部署。
Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking
文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。
这场巅峰对话,把China AI的基因、堵点和未来聊透了|甲子光年
2025年4月28日,甲子光年大会巅峰对话探讨‘China AI如何重塑全球AI价值坐标系’。大模型、算力、具身智能、芯片领域嘉宾各抒己见,谈China AI基因、应对策略、行业堵点及未来判断。
在场Vol.6 |《牛来》:粗糙什么时候能成为一种风格?
本期《在场》观察动画电影《牛来》,它因“粗糙”引热议,观众边吐槽边截图讨论其色彩与构图。文章借这一现象探讨“粗糙”与“风格”区别,还结合艺术史和AI时代分析作品完成度与风格的关系。
你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布
文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。
用AI重新审视人类发明史:我们的技术本该比现在更先进吗?
美国研究员 Brian Potter 用 AI 分析 1800 年到 1970 年代 190 项重大发明,判断最早何时能造。结果显示多数发明没迟到太久,1900 年后发明间隔缩短,75%约束是技术性的。
LLM越狱攻击的威胁被系统性高估? 基于分解式评分的「越狱评估新范式」出炉
目前LLM越狱攻击评估常依赖间接指标或LLM宏观判断,易有偏差。德国、中国等研究团队提出JADES框架,用分解式评分机制,揭示过去高估越狱攻击威胁,为评估建新标准。
告别复杂提示词!蚂蚁新方式让AI自动理解你的个性化需求
蚂蚁通用人工智能研究中心自然语言处理实验室提出AlignXplore方法,通过强化学习让AI从用户行为归纳偏好并动态更新。该方法训练分两阶段,支持流式偏好推断,实验表现优异,是大模型个性化新尝试。
14%论文都有AI代写?Nature:每7篇就有1篇藏有ChatGPT特征词
据Nature报道,研究发现在2024年PubMed上超20万篇生物医学研究摘要频繁出现LLM特征词。部分国家和学科中,AI辅助写作比例超五分之一且趋势上升,作者还会引导LLM规避痕迹。
吴恩达来信:AI项目时间紧任务重?不妨简化你的构想
吴恩达分享在AI项目中获取实践经验的技巧,若时间有限,可缩小项目规模。他以构建“听众模拟器”为例,展示如何在有限时间利用编程助手完成基础版本,还能获反馈推进项目。