# NOAI 2026: 知乎场景下的用户意图识别

注意：本题评测环境使用 `noai:2026v1.1` 镜像，该镜像不包含 Qwen3-4B-Instruct 模型。参赛者可在开发阶段使用预置该模型的 `noai:2026v1` 镜像，但提交的 Notebook 不得依赖 Qwen3-4B-Instruct 模型运行，否则将在评测环境中执行失败。



## 1. 任务描述

意图识别（Intent Recognition）是 AI 搜索产品中的一项核心任务，其目标是根据用户输入判断用户意图，并将查询路由至相应的下游模块，例如本地生活、健康问答和小说检索等。

本题以某 AI 搜索类产品的真实场景为背景，包含用户单轮直接搜索与多轮人机对话两种输入形式。选手需要根据输入文本，将每条输入文本划分至以下 16 个预定义意图类别之一。

### 1.1 意图类别

| 意图             | 说明                                                       |
| ---------------- | ---------------------------------------------------------- |
| 游戏技巧         | 查询游戏攻略、秘籍、操作技巧或通关方法                     |
| 游戏角色信息     | 查询游戏角色的出装、皮肤、获取方式、性格设定或二次创作内容 |
| 周边饭馆         | 查询景点、社区、住所等地点周边的餐馆                       |
| 查找高端酒店     | 查询四星级、五星级或高评分酒店                             |
| 查找地址         | 查询饭店、酒店、公园、学校等地点的具体地址                 |
| 健康知识         | 查询保健、养生及健康生活相关知识                           |
| 查找医疗信息     | 查询医院、医生、疾病或症状相关信息                         |
| 美容化妆技巧     | 查询美容、化妆、医疗美容或整形相关知识与技巧               |
| 美食烹饪技巧     | 查询菜谱、做法、烹饪步骤、食材处理等问题                   |
| 软件开发问题     | 咨询编程语言、开发框架、程序性能或调优等开发问题           |
| 软件使用问题     | 咨询软件安装、配置或使用过程中遇到的问题                   |
| 查找小说剧情     | 查询小说内容、情节或剧情发展                               |
| 查找小说角色信息 | 查询小说的人物信息，包括基本信息、性格、特殊事迹等         |
| 查找营业时间     | 查询银行、商店、酒店、餐馆或其他服务场所的营业时间         |
| 法律法条解释     | 查询法律、法规或政策条文的含义与解释                       |
| 法律问题咨询     | 针对具体问题或案件进行法律咨询                             |

### 1.2 输入数据格式

每条样本的 `input` 字段可能为以下两种形式之一：

1. **单轮用户输入**：用户直接输入的一条查询文本，例如：

   ```
   越南春卷的做法
   ```

2. **多轮人机对话**：由若干条以 `usr:` 或 `sys:` 开头的消息按时间顺序组成，其中 `usr:` 表示用户消息，`sys:` 表示系统回复，例如：

   ```
   usr: 您好，我想找一家评分 4.5 分以上的餐馆
   sys: 为您推荐 XX 餐厅
   usr: 这家店周边有什么酒店吗？
   ```

**对于多轮对话，意图标签以最后一条 `usr:` 消息表达的意图为准，之前的对话内容仅作为上下文参考。**，前文的对话历史仅作为上下文参考。[baseline](https://www.bohrium.com/notebooks/44754271216)代码中提供了 `extract_user_utterance` 和 `preprocess_input_text` 等预处理函数作为参考，参赛者也可自行设计文本预处理方法。

---

## 2. 数据集

| Split                       | 样本数 | 说明                                                         |
| --------------------------- | ------ | ------------------------------------------------------------ |
| 训练集 (Train)              | 16     | 共包含 16 条有标签样本，覆盖全部 16 个意图类别，每个类别仅提供 1 条示例。 |
| A 榜验证集 (Validation Set) | 2,500  | 无标签                                                       |
| B 榜测试集 (Test Set)       | 2,500  | 无标签                                                       |

训练集每条样本包含 `input`（输入文本）与 `label`（意图标签）两个字段；测试集仅包含 `input` 字段。

训练集数据示例：

```json
{"input": "越南春卷的做法", "label": "美食烹饪技巧"}
```

在开发阶段，参赛者只能直接访问训练集。验证集和测试集仅在正式评测环境中提供，参赛者需通过指定的环境变量读取其存储路径，具体方式请参见[baseline](https://www.bohrium.com/notebooks/44754271216) Notebook。



## 3. 镜像中预置的模型与训练集中预置的模型

### 3.1 在镜像中预置的LLM模型

`noai:2026v1` 镜像中预置了 Qwen3-4B-Instruct 模型，参赛者可在开发阶段调用该模型。具体使用方法可参见[baseline](https://www.bohrium.com/notebooks/44754271216) Notebook。

**注意**：Qwen3-4B-Instruct 仅可在开发节点中使用，评测环境中无法调用。参赛者可使用该模型对训练样本、类别定义或自行构造的文本进行处理，并将开发阶段生成的静态产物保存至附加数据集。提交的 Notebook 不得在运行时调用或依赖该模型。操作方法请参考《NOAI 2026 Bohrium 用户说明文档》

### 3.2  在训练集中预置bert-base-chinese模型

训练集中提供预训练的bert-base-chinese模型，可以进行微调操作。由于评测机可以访问训练集，所以提交后训练和预测阶段可以访问训练集中预训练bert-base-chinese模型。具体使用方法参见[baseline](https://www.bohrium.com/notebooks/44754271216) Notebook。



## 4. 任务

训练一个意图识别系统，对测试集中的每一条输入进行意图分类。



## 5. 提交

参赛者需提交一个名为 `submission.ipynb` 的 Notebook。可最多附带一个`数据集`。`数据集`大小不超过5MB。

### 5.1 输入与输出

- **输入**：训练集、验证集和测试集和访问和获取详见[baseline](https://www.bohrium.com/notebooks/44754271216)代码。
- **输出**：Notebook 运行结束时必须在当前目录下生成一个 `submission.zip` 文件，包含：
  - `submission_val.jsonl` — 验证集预测结果
  - `submission_test.jsonl` — 测试集预测结果

### 5.2 文件结构

请参见基线 Notebook 中的完整文件结构。

### 5.3 Notebook生成的 JSONL 格式

每个文件中每行为一个 JSON 对象，**必须与对应测试集的样本顺序严格对齐**：

```json
{"label": "美食烹饪技巧"}
```

---

## 6. 评分

### 6.1 指标：加权 F1 分数（Weighted F1 Score）

对于每一个类别 $i$，根据精确率和召回率计算 F1：

$$F1(i) = \frac{2 \times \text{Precision}(i) \times \text{Recall}(i)}{\text{Precision}(i) + \text{Recall}(i)}$$

假设总共有 $N$ 个类别，第 $i$ 个类别的样本数量为 $w_i$，总样本数为 $W = \sum_{i=1}^{N} w_i$：

$$\text{Weighted F1} = \sum_{i=1}^{N} \left( \frac{w_i}{W} \times F1(i) \right)$$

### 6.2 公开榜与私有榜

- **公开榜（A 榜）**：根据验证集（Validation Set）进行计算；
- **私有榜（B 榜）**：根据测试集（Test Set）进行计算，并在比赛结束后公布。



## 7. 限制

- 本题评测机使用的镜像为 `noai:2026v1.1`，该镜像不包含 Qwen3-4B-Instruct 模型。解题过程中可使用 `noai:2026v1` 镜像，其中已预置 Qwen3-4B-Instruct 模型；所以，如果提交的Notebook中保留使用 Qwen3-4B-Instruct 模型的代码，一定会报错。
- 不允许使用出本题外的外部大语言模型 API（如 GPT、Claude）进行预测、特征生成、数据标注或模型集成；
- 评测环境不提供网络访问，参赛程序不得执行联网操作，也不得通过 `pip install` 安装额外依赖。参赛者只能使用指定镜像中预装的软件包；
- 本题使用**GPU**进行训练和评测，训练 + 推理总时长不超过 25 分钟。



## 8. 基线分数与参考分数

- **B 榜基线分数 ([baseline](https://www.bohrium.com/notebooks/44754271216))**：0.1133
- **科学委员会提供的参考解答B榜分数 (Reference Result)**：0.8154



## 9. 致谢

- 感谢”知乎“技术专家提供本题。