全量数据采集与结构化预处理
数据闭环通过 Python 爬虫抓取研招网 2026 年硕士专业目录,覆盖 367 所院校、3496 条 408 招生记录,并清洗为 24 个结构化字段。 在此基础上完成科目组合分类:11408(英一+数一+408)、22408(英二+数二+408)、其他 408,为后续推荐与风险评估奠定确定性数据底座。
院校难度分层与标签体系
预处理为降低用户决策成本,对院校专业自动打标签: 985 或自划线院校 = 冲;211 / 双一流 + 22408 = 稳;普通院校 + 22408 = 保;11408 非 985 = 稳。 同时抽取 985、211、双一流、自划线等层次标签,让用户在结果页一眼识别目标难度,避免在原始数据中反复对比。
Profiler + Critic 双 Agent 协作
多 Agent 架构
Profiler Agent 负责多轮画像:从自然语言中提取本科层次、数学/英语基础、风险偏好等必填字段,缺字段时一次性追问;通过记录"上一轮在问什么",正确理解"强""都可以"等无主语回答,避免死循环。
Critic Agent 负责单轮风险审查:基于画像与候选结果,识别偏好错配、自划线风险、科目难度错配、招生规模过小、空结果与数据盲区,让推荐从"只说好话"变成"指出风险"。
玻璃盒推理与确认机制
可解释 AI画像 → 筛选 → 推荐理由 → 风险审查的每一步都写入共享记忆,并以时间线形式展示给用户,拒绝黑盒推荐。 字段齐全后进入"确认阶段",用户回复"确认"才自动触发分析,避免误操作;无 LLM Key 时也能通过规则路径完整运行,保证离线可演示。