为了让 AI for Poetry 具备「真伪判别」能力,我们构建了 ChineseHardJudgePoem:由四个 QLoRA 微调的风格模型(李白 / 海子 / 海子-中文约束 / 顾城)模仿真实诗歌数据集创作,共 5000 条带相似度标注的样本。
每条样本包含与同标题真实诗的字符 2-gram Jaccard / 余弦相似度,以及风格池平均相似度。基座为 Qwen2.5-3B-Instruct,QLoRA 4-bit 量化后单张 RTX 4060 Laptop 8GB 即可完成训练。
这个数据集不仅是判别器的训练原料,也为「风格保真度评估」提供了量化基准——我们用它来回答一个创作问题:这首诗,像不像某个诗人写的?