本页小节
为什么单独做这一页:官方通知只写「大模型提示词 + 大小模型协同」,没有规定怎么实现。同样一句规则,至少能长出四种投入完全不同的技术路线,而选错路线的代价通常要到预赛大组晋级赛才会暴露。这一页把「可能的走法」摊开,方便先选路、再开工。
01先确定:这到底是哪一类赛题
同一个赛项,可以被理解成三种不同性质的题目。三种理解会导致完全不同的训练方法,先对齐:
理解 A:提示词工程赛
官方要求提交「含大模型提示词的红蓝双方博弈智能体及设计报告」,评分维度里「提示词设计与指令执行效率」占 15 分。把重心放在提示词与知识库设计上,符合官方表述。
理解 B:多智能体系统赛
决策点横跨红蓝双方各 6 类(发射车状态、航路、目标分配、波次、队形、拦截分层),且要求大小模型协同。按分布式决策系统来做,重心在角色分工、通信与状态机。
理解 C:运筹优化赛
得分公式明确含经济惩罚(成本比超阈值扣分)与毁伤得分,目标分配、拦截分配本质是武器-目标分配(WTA)与资源调度问题。按优化问题建模,大模型只做上层规划。
建议口径:把它当成 A + B + C 的叠加——大模型做目标分解与方案生成(A),多智能体分工执行(B),小模型/求解器负责目标分配与成本控制(C)。这正好对应评分维度中「战术决策适配性 30 分 + 协同机制 25 分 + 提示词 15 分」的结构。
02四条技术路线对比
| 路线 | 核心做法 | 适配队伍 | 投入 | 主要风险 |
|---|---|---|---|---|
| 路线一 提示词优先 |
用一个效果较好的大模型,把绝大部分功夫花在提示词、知识库(RAG)与输出格式约束上;小模型只做格式校验与简单计算 | 算法储备薄、但有人懂任务本身;首次参赛 | 低 | 上限受模型能力限制;遇到强对手时策略深度不足;提示词微小改动易引起成绩大幅波动 |
| 路线二 大小模型协同 |
大模型负责战略目标拆解与战术规划,小模型/规则模型负责路径规划、火力分配、拦截分配等实时计算;两者之间定数据契约 | 有工程能力、能做系统集成的队伍 | 中 | 接口延迟与错误传播;若协同设计讲不清楚,「协同机制」25 分拿不满 |
| 路线三 求解器驱动 |
把目标分配、波次组织、拦截分配建模为优化问题(WTA / 背包 / 调度),用求解器或启发式搜索出解,大模型负责意图理解与方案解释 | 有运筹优化或强化学习背景 | 中高 | 模型与真实裁决规则存在偏差时会系统性失准;创新性维度(20 分)可能被认为「沿用传统规则」 |
| 路线四 离线进化 + 在线推理 |
赛前用大量自对局/自演化搜索出策略库或参数,赛中只做检索与轻量化推理 | 有算力、有仿真自对局条件 | 高 | 过拟合到自己的自对局分布;官方平台版本变化会失效;赛事对模型调用词元/响应时间有限制 |
组合建议:以路线二为骨架(因为评分细则明确考核「大小模型协同机制」25 分),在关键子问题上用路线三的求解器(目标分配、拦截分配),提示词与知识库按路线一的标准打磨。路线四作为有余力时的增强手段,不建议作为唯一路线。
03四种参赛目标,四条不同的精力分配
| 目标 | 评判标准 | 精力分配建议 |
|---|---|---|
| 冲名次 | 机机对抗得分(占 70%) | 把 70% 以上时间投入自对局与策略调优;设计报告保证完整但不追求篇幅;必须建立可复现的评测流水线 |
| 保二等奖 / 一等奖 | Z = X + Y 总分 | 对抗能力与报告并重;优先把「协同机制 25 分 + 提示词 15 分 + 文档规范 10 分」这些可控分拿满 |
| 拿专项奖(优秀创意奖 / 优秀算法奖) | 按代码与设计报告从设计思路、训练效率、策略分析等维度评判,原则上不超过参赛队的 50% | 把创新性当作主线:提出可命名的机制、给出消融实验与对照,明确说明「为什么这样设计」 |
| 学习 / 复现 | 能完整跑通两阶段、理解赛制 | 按「资源与路径」页的八周计划推进,重点是把官方附件读透,而不是追求成绩 |
04评分结构倒推的投入分配
官方把 30% 的分数(Y)给了「代码 + 设计报告」,且公布了 5 个维度的分值。据此可以把不可控的「胜负」之外的分数逐项拆出来:
| 可控得分项 | 分值 | 要交付什么证据 |
|---|---|---|
| 大模型与小模型协同机制 | 25 | 代码里有清晰的大小模型接口与数据交互模块;文档里专门有一节讲协同架构与分工边界 |
| 大模型提示词设计与指令执行效率 | 15 | 提示词模板与版本记录;说明如何约束输出格式、如何降低指令转换歧义与延迟 |
| 大模型相关代码与文档规范性 | 10 | 模块化代码 + 注释说明输入输出;文档讲清「态势输入 → 决策输出」全流程 |
| 大模型战术决策与场景适配性 | 30 | 态势解析模块;红蓝双方角色切换时决策逻辑自洽的验证记录 |
| 大模型策略生成的创新性 | 20 | 设计文档中的创新点章节;多轮对抗中的迭代优化记录 |
上表为 B 卷(满分 100)内部的分值,最终按 30% 折算计入 Y。数值来自官方附件《预赛评分标准与细则》。
05对手的几种可能,与对应的预案
机机对抗的 70% 取决于对手。公开渠道拿不到对手名单,但可以按可能出现的对手类型准备预案:
对手类型
- 强攻型:不计成本饱和打击,追求高毁伤
- 消耗型:用低成本弹群消耗拦截资源
- 龟缩型:雷达静默、保守机动,等你犯错
- 规则利用型:卡冷却时间、卡暴露窗口、卡评分阈值
准备方式
- 自建对手池:至少实现 2–3 种基线策略,轮换训练,避免只适应一种对手
- 为每种对手类型准备可切换的策略参数而不是重写代码
- 记录每种对手下的成本比(C_red / C_blue),避免赢了场面却触发经济惩罚
- 把「对手类型识别」做成赛中可执行的判断逻辑,而不是事后分析
06风险与失分预案
| 风险 | 影响 | 预案 |
|---|---|---|
| 平台版本变化 / 接口字段调整 | 高 | 把平台调用收敛到一个适配层,业务代码只依赖自己的内部 schema;每次拿到新版本先跑一遍回归用例 |
| 模型响应超时或词元超限 | 高 | 设置三级降级:大模型超时 → 用缓存方案 → 退回规则基线;把每一步的最坏耗时测出来 |
| 输出格式不合规导致指令被丢弃 | 高 | 在发送前做 schema 校验,校验失败自动重试一次并降级;记录被丢弃指令的数量作为监控指标 |
| 经济惩罚触发 | 中 | 在成本比接近阈值(红 1.5 / 蓝 1.2)时主动收敛;把成本比做成实时的决策约束而非事后统计 |
| 只准备了一方(红或蓝) | 高 | 官方要求提交红蓝双方智能体,且每场分两局分别执红蓝;两侧都要有可用基线 |
| 设计报告与代码不一致 | 中 | 报告写完后按报告逐条对照代码自查;评审看的是「代码里的协同模块 + 文档里的协同架构」是否对得上 |
| 只顾自对局,忽略文档 | 中 | 把报告写作排进计划并留出固定时间;30% 的分数在这里 |
07选定路线之后下一步
- 读官方附件:把当届《智能体开发指南》《评分标准与细则》各读一遍,把字段与阈值抄进自己的 schema(赛事页已给出要点,仍需以 PDF 原文为准)。
- 定路线与分工:按本页第 02 节选路线,按「备赛清单」页分角色。
- 先跑通最小闭环:一次 Step → 一次 GetCurrentStatus → 一次 Act,能在平台上产生可见变化,再谈策略。
- 建评测:先有可复现的自对局与指标,再做优化;否则无法判断改动是否有用。
- 补文献:按「学术文献」页按主题检索,重点看大小模型协同与多智能体协作两类。