一、为什么必须做基线如果只训练 BERT就无法回答“复杂模型到底带来了多少收益”。基线模型可以帮助我们判断任务是否主要依赖关键词、模型复杂度是否值得、线上应优先考虑精度还是延迟。二、参与对比的模型1. TF-IDF Logistic RegressionTF-IDF 根据词在文本中的重要程度构造向量逻辑回归完成分类。它速度快、实现简单适合作为最基础的文本分类基线。2. TF-IDF Random Forest随机森林由多个决策树组成对非线性关系有一定表达能力但高维稀疏文本向量并不总是适合树模型。3. FastTextFastText 使用词和子词 n-gram能够捕捉“物流慢”“质量差”等短语和局部模式对中文短文本分类尤其有实用价值。4. BERTBERT 通过上下文建模理解句子语义模型能力更强但计算和部署成本更高。三、实验对比模型AccuracyMacro-F1模型大小推理延迟FastText94.64%86.56%约 50MB约 0.05msBERT88.80%78.51%约 390MB约 5.94msTF-IDF LR87.96%76.87%约 10MB约 0.41msTF-IDF RF86.57%72.05%较小约 0.20ms指标来自当前项目实验资料具体结果会随数据版本和训练参数变化。四、为什么 FastText 反而更好这并不代表 BERT 一定失败。投诉分流数据中存在大量强关键词和固定短语而且商品质量类占比很高。FastText 的子词 n-gram 能快速抓住这些模式而当前 BERT 实验训练轮数较少未必充分收敛。这说明短文本不一定需要最大模型数据分布会影响整体指标Accuracy 高不代表每个少数类都好线上选型必须综合效果、延迟、体积和成本。五、工程上的最终选择可以采用分层策略高吞吐、模式明确的样本使用 FastText复杂或低置信度样本交给 BERT 复核资源受限场景使用蒸馏模型或量化模型所有自动结果保留置信度必要时进入人工复核。六、总结基线不是“为了凑实验数量”而是帮助团队做理性技术选型。一个成熟的 AI 项目不应该因为模型名字高级就忽略真实数据上的效果和部署成本。