「多任务统一输出」共找到 2560 篇相关文章
重复一下提示词,Gemini准确率竟从21%飙升至97%!
Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流大模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。
阿里新王牌千问 APP 曝光:全面硬刚 ChatGPT
11月14日阿里开启「千问 APP」公测,其集成通义千问 Qwen 系列顶尖模型,有多模态能力。它对标 ChatGPT,在中文语境和结构化输出上有优势,实测处理财报、麻将推理等表现佳。
腾讯发布超低成本AI训练法!120元效果秒杀70000元微调方案
腾讯提出无训练组相对策略优化Training-Free GRPO,无需调整参数,在提示词中学习经验就能提升模型性能。实验显示,该方法在数学推理和网页搜索任务上效果显著,成本远低于传统方法。
视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理
谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。
GPT-5-Codex 一手实测
OpenAI推出新编程模型GPT - 5 Codex,Every团队实测显示其表现狂野。它能动态选思考时间,可在不同开发环境无缝切换,代码审查更优。但也存在对任务挑剔、环境设置麻烦等问题。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。
提升大模型内在透明度:无需外部模块实现高效监控与自发安全增强|上海AI Lab & 上交
大语言模型能力提升引发风险担忧,当前主流用外部“黑盒”监控模块解读模型表征,存在诸多局限。上海人工智能实验室和上海交通大学团队提出TELLME方法,摒弃外部模块,提升模型内部透明度,还提升了输出安全性。
AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集
上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。
4.8K Star!一套面向设计工程师的 AI 编码智能体 UI 技能集合!
前端开发中AI生成代码质量参差不齐,ui - skills项目应运而生。它由开发者ibelick创建,是面向设计工程师的UI技能集合,将开发经验转化为规则,通过CLI工具让AI按规则构建和审查代码,已获4.8k Stars。
大模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背
马里兰大学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。