ARCHIVE · 2026年8月27日
今日智讯全部归档
2026年8月27日 · LLM 整理
今日聚焦大模型推理、评估与训练研究,以及OpenAI定制推理芯片和Google AI产品更新。arXiv论文涵盖NL2SQL基准、LLM智能体实验、代码偏好优化、生成建模与多模态注意力等方向。
产业 · OpenAI
OpenAI公布了其定制推理芯片Jalapeño的首批测试结果。
站内阅读
模型 · arXiv cs.AI
ESQ-Bench是一个面向企业级NL2SQL的基准测试,针对Oracle等企业数据库方言和静默语义偏差问题。
研究 · arXiv cs.AI
该研究提出一个多智能体框架,让LLM智能体在制药过程设计中利用高保真仿真模型执行受控实验。
STEP-KTODER是一个代码偏好优化框架,将步骤定义为多函数程序中的模块级函数,并通过自动生成的单元测试赋予二元正确性标签。
研究 · arXiv cs.LG
该研究提出重整化群流匹配(RGFM),利用重整化群的准局域性和尺度分离特性,将生成过程按空间尺度从长波到短波逐步进行。
模型 · arXiv cs.CL
VIB-ICL是一个基于信息瓶颈原理的框架,用于解释和改善多模态上下文学习中的视觉忽略现象。
研究 · arXiv cs.CL
这是一项评估大语言模型创造力自动评估方法可靠性的研究。
本文提出Agentic Data Evolution(ADE)框架,用于解决大语言模型对齐人类中心目标时验证困难的问题。
本文为OpenAI首席财务官对芯片、计算、模型和产品进步如何复合推动智能规模化的阐述,属于观点性内容,未提供具体数据或可验证的技术结论。
本研究系统评估了12个指令微调开源大语言模型在六个因果图基准上作为直接因果边分类器的可靠性,测试了五种提示策略和四种置信度来源。
本文提出校准保持剪枝(CPP)方法,将模型压缩视为可靠性契约,在剪枝的同时保持保形预测的集合大小效率。
综合 · arXiv cs.CL
本文是一篇急诊科自然语言处理综述,系统分析了46篇论文,覆盖分诊、诊断和处置三个阶段,涉及分诊分类、临床摘要、自动诊断、报告生成和出院文书等任务…