55 · 中游 / Midstream

数据、评测与中间件

没有数据管线、向量检索与评测,模型无法变成可靠系统。

标注与合成数据、数据飞轮、向量数据库、特征/实验平台、安全护栏与基准(如 SWE-bench)构成模型上下游的“润滑层”。应用公司大量成本花在这里,而不是再训一个基座。

角色

这一层谁在干活

数据生产

采集、清洗、标注、合成与合规,决定预训练与对齐上限。

  • 标注产线
  • 合成数据
  • 版权与隐私合规

检索与记忆中间件

RAG、向量库与记忆组件,把企业私有知识接到通用模型。

  • 向量数据库
  • 企业搜索
  • Agent 记忆

评测与安全

基准、红队与护栏,连接研究声明与可上线标准。

  • SWE-bench
  • LMSYS
  • 内容安全策略
馆内机构

可点进档案的公司

Hugging Face开源模型与数据集协作平台,Transformers 库定义了现代 LLM 工程默认接口。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。 Anthropic以 AI 安全为核心、以长上下文和可靠 Agent 为产品特色的大模型公司。 Cohere面向企业检索增强与 Agent 的 Command 系列模型公司,强调 RAG、工具调用与私有部署。 IBM从 Deep Blue、Watson 到 Granite 开放企业模型,服务受监管行业。
概念

读懂这一层

RAG(检索增强生成)让大模型在回答问题前先检索外部知识库,从而获取最新、准确的信息。 数据集(Dataset)用于训练、验证与测试模型的结构化样本集合及其标注与协议。 合成数据由模型或仿真生成、用于训练与评估的数据,用来补足真实数据的稀缺、敏感或标注成本。 RLHF(基于人类反馈的强化学习)通过人类对模型输出的偏好反馈来优化模型行为的训练方法。
专题

相关主题路线

检索增强 AI 安全 AI 治理与监管 AI Infra

试试搜索