「幻觉评估」共找到 918 篇相关文章
Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更具性价比了
Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。
【万字长文】大模型训练推理和性能优化算法总结和实践
本文总结大模型落地的训练、推理和性能优化算法与实践,介绍语言模型发展,对比BERT、GPT等训练方式,分析生成式大模型问题,还阐述数据处理、推理优化及训练调优等内容,并给出不同场景技术选型建议。
快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!
近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。
语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究
清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。
AI 正当时,实践正落地:2025 AICon 深圳站圆满收官
8月22 - 23日,2025 AICon深圳站圆满落幕,超800位从业者参与。大会汇聚多企业专家,围绕多热点探讨。极客邦霍太稳指出AI从模型比拼到落地实践。多位嘉宾分享经验,如阿里云蒋林泉、快手周国睿等。还有多场硬核分享及开发者展区。
JinaVDR: 一个图文混排文档搜索任务的基准集
现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。
The Batch: 852 | 加州重新制定人工智能监管框架
加州人工智能前沿模型联合政策工作组发布《加州前沿人工智能政策报告》,为立法者提供监管尖端AI模型的政策原则。报告聚焦前沿模型监管,提出综合多源证据、鼓励信息披露等结论,还探讨了美国AI监管现状。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
回复:用 AI 辅导教学问题
家长询问用Gemini 2.5 pro的OCR功能辅助孩子预习九门课程的问题,包括撰写提示词、有无更合适AI方案、家长角色及评估学习成果等,回复给出对应建议,如没必要上传教材等。