推理密集型信息检索」共找到 2626 篇相关文章

算法论文8

AI模型守法率提升11%,港科大首次用法案构建安全benchmark

香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。

新智元
开源动态7

从科学论文自动生成视频

该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。

GitHubStore
开源动态8

外卖公司也能搞AI?

昨天凌晨美团悄悄开源560B参数的MoE大模型LongCat-Flash-Chat,引发国外网友疑惑。该模型推理速度超100 tokens/秒,基准测试表现出色,多项设计解决实际问题,贴合美团业务需求。

AGI Hunt
开源动态8

谷歌开源高效文本提取 Python 库LangExtract

谷歌开源 Python 库 LangExtract,能用大语言模型从非结构化文本提取结构化信息。它定位精确、输出可靠,支持多模型,适应多领域,还能处理长文档,通过示例介绍了使用方法。

GitHubStore
算法论文8

AI“压力面”,DeepSeek性能暴跌近30% | 清华&上海AI Lab

上海人工智能实验室等团队设计REST框架,在一个prompt里抛多问题模拟复杂推理场景。结果显示,DeepSeek - R1等模型高压下性能大幅缩水,REST能拉开不同模型差距,还揭示评测方法局限。

深度学习自然语言处理
新闻资讯7

作为软件架构师使用 AI 的经验

Avraham Poupko 在 OOP 大会分享软件架构师用 AI 经验,认为软件架构师不会被 AI 取代,AI 适合探索权衡、提炼语言,但缺乏情境推理和情感智能,人类在这方面更有优势。

InfoQ
新闻资讯7

爆冷!字节Seed 在CCPC 决赛只做出一道签到题,而DeepSeek R1 直接挂零?

第十届 CCPC 举行,字节 Seed 携 Seed - Thinking 参赛,仅做出一题,DeepSeek R1 挂零。不同模型架构在比赛中差异不大,暴露出大模型做算法题短板,推理模式模型表现更好。

AI前线
开源动态7

完全复刻火爆全网的机器鸭

这是对Pollen Robotics Microduck的第三方复刻研究,从官方公开的MJCF仿真模型反推出装配图、爆炸图和可直接导入CAD的装配体。该机器鸭软件开源、硬件不开源,但已有信息足以还原装配关系。

GitHubStore
新闻资讯7

Karpathy从Anthropic离职了?个人简介修改引发全网猜测

官宣入职Anthropic才俩月,Andrej Karpathy修改个人简介去掉公司信息,引发离职猜测。有未经证实消息称其已提交辞职申请,同时Anthropic未参与开源AI公开信联署,目前离职说法待证实。

机器之心
新闻资讯7

Anthropic "泄露"Claude Mythos 最强模型到底有多猛?

Fortune爆出Anthropic因CMS配置失误,致新模型Claude Mythos信息泄露。该模型有阶跃式进步,在多领域表现超前代,网络安全能力突出。此事反映AI迭代快但安全待提升,安全成模型评估关键。

CourseAI