「深度研究系统」共找到 3911 篇相关文章
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
一个模型读懂所有医学数据,Hulu-Med探索医学大模型开源新范式 | 浙大x上交xUIUC
Hulu - Med是浙大、上交、UIUC等联合提出的通用医学视觉语言大模型,首次在单一模型统一理解医学多类数据。它开源透明,训练成本低,性能媲美GPT - 4.1,为医学AI带来新范式。
刚刚,GPT-5.1发布,OpenAI开始拼情商
深夜,OpenAI上线GPT - 5.1 Instant和GPT - 5.1 Thinking模型。前者更温暖智能、指令执行强,后者处理任务更高效易理解,语气温暖。模型将逐步推出,还发布系统卡附录。
破局大模型训练黑盒,MegatronApp开源实现万亿参数「可视可控」训练
在2025上海QCon大会上,算秩未来赵伯罕博士指出万亿级大模型训练困境。上海期智研究院和算秩未来联合研发MegatronApp,以低入侵方式补齐链路,其四个模块形成闭环,让训练从黑盒变白盒,项目已开源。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”
来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。
小红书RecSys 2025最佳论文提名背后:破解视频时长预测难题
小红书推荐算法团队论文《Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network》在 RecSys 2025 获最佳论文提名。该文剖析视频时长预测难题,提出 EGMN 模型,线下线上验证效果佳。
让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准
上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。
基础模型已颠覆科研,进入第五范式!港科大综述113篇论文 | NeurIPS'25
港科大论文指出,随着科学问题复杂度提升,传统科研范式显露出局限。基础模型(FMs)横空出世,具备通用性、规模与知识覆盖、推理与生成能力,可能引领科学进入第五范式,但也面临偏见、幻觉等问题。
24个月,从写第一行代码到破产:一位架构师在47个“死亡”项目里,看到的共同陷阱
架构顾问审阅47家初创公司代码库,发现它们因产品无法扩展、技术债积累走向停滞。提出花两周做架构可避免问题,还指出AI虽降低开发门槛,却加速技术债积累。