高阶

业绩指引变化量

Read in English

交易管理层措辞的变化,而不只是 EPS 这个标题数字

为什么要做这件事

大多数人对财报的反应都盯着超预期还是不及预期。更好的 alpha 往往来自 管理层这次说的话与上个季度说的话之间的差异。GPT 式抽取之所以有用,是因为它能在大量标的上批量比较语气、细节和指引措辞,而不必把一切压缩成一个粗糙的正负分数。

优势藏在哪里

市场会先给标题数字定价。真正需要更长时间才被定价的,是 预期修正的路径。一家公司可以业绩超预期,却仍然是个糟糕的形态——只要它的需求措辞在恶化、毛利率的表述在软化,或者管理层在回避追问。另一家公司可能小幅不及预期,却成为强势的多头标的——只要指引措辞明显改善,而分析师仍锚定在旧的叙事上。

这就是为什么成熟的财报策略不太关注"超预期还是不及预期",而更关注 对未来路径的预期发生了什么变化.

  • 指引漂移: 公司是不是在悄悄给下个季度降低预期?
  • 语气的不对称: 准备好的发言很乐观,问答环节却转向谨慎?
  • 预期修正的空间: 分析师读完这次电话会后,会上调还是下调预测?
  • 横截面排序: 相对同业而言,哪些标的改善得最明显?

信号的组成部分

一个稳健的信号会比较四样东西:

  • 本次指引与上次指引
  • 本次措辞与上次措辞
  • 管理层的表述框架与卖方共识的表述框架
  • 准备好的发言与问答环节在语气和细节上的差异

高价值的措辞类别

  • 营收展望: 加速、减速、销售漏斗强度、订单量、管线质量
  • 利润率: 定价能力、促销力度、产品结构变化、运费、人工、投入成本
  • 需求的质感: 企业端的降本增效、宏观上的谨慎、销售周期拉长、渠道库存
  • 资本配置: 股票回购、资本开支、招聘、重组、项目时点
  • 库存与在手订单: 库存回归正常究竟是利多还是利空,取决于所处行业

结构化抽取的数据结构

强制让输出遵循一个带版本号的数据结构,这样它才可测试、可比较。

{
  "revenue_outlook_delta": -2 to 2,
  "margin_outlook_delta": -2 to 2,
  "capex_intensity_delta": -2 to 2,
  "demand_tone_delta": -2 to 2,
  "inventory_commentary": "improving | stable | worsening",
  "prepared_remarks_score": -2 to 2,
  "qa_score": -2 to 2,
  "management_credibility": 0 to 1,
  "confidence": 0 to 1,
  "evidence_spans": ["quote 1", "quote 2"]
}

为什么问答环节值得单列一个字段

准备好的发言是精心打磨过的,问答环节才会暴露压力点。如果管理层照本宣科地重复同一套说辞,但被问到订单时点、库存、渠道健康度或促销力度时开始闪烁其词,这比开场白里那些泛泛的乐观重要得多。

排序与组合逻辑

好的排序引擎会把文本抽取与市场环境结合起来。文本模型负责提出候选标的,排序模型负责判断这笔交易是否仍然值得做。

多头排序的基础输入

  • 指引变化量明显为正
  • 问答环节得分改善
  • 预测修正为正,或正在改善
  • 相对成交量偏高
  • 跳空幅度还没大到把优势消耗殆尽

空头排序的基础输入

  • 需求或利润率的措辞在恶化
  • 问答环节明显弱于准备好的发言
  • 市场共识仍然过于乐观
  • 看似超预期的数字背后,藏着一个看空的形态

简单的综合评分

财报 Alpha =
    0.30 * guidance_delta
  + 0.20 * qa_delta
  + 0.15 * margin_delta
  + 0.15 * demand_delta
  + 0.10 * estimate_revision_trend
  + 0.10 * relative_volume_confirmation

重要的不是这些权重的具体数值,而是你要在同一个财报窗口内,把标的与其同业做横截面排序。把它当作一套 最高十分位/最低十分位 的系统来用,效果远好于孤立地押注单只股票。

执行规则

最常见的错误是入场太急,把整个信号的价值都付在了隔夜跳空里。

实用的持仓规则

入场:财报后第 1 天收盘,或第 2 天开盘
持有:5 到 15 个交易日
离场:信号衰减、预期修正反转,或按 ATR/跳空回补设置的止损
组合:排名前 5 的多头、排名前 5 的空头,并做行业标准化

需要回避的情况

  • 抛物线式的跳空,行情中最好的一段已经走完
  • 流动性差的标的,滑点会盖过预期优势
  • 准备好的发言很强、问答环节却明显偏弱的公司
  • 同业和供应商的表现,与管理层的乐观说法相互矛盾的标的

最干净的做法通常是等第一波反应结束后再入场,然后在接下来的一到三周里收割预期修正带来的漂移。

验证框架

  • 测试 1 日、5 日、10 日和 20 日的前瞻收益
  • 对每一次排序都做行业标准化
  • 把大幅跳空和小幅跳空分开统计
  • 跟踪命中率、平均盈利、平均亏损和换手率
  • 每次提示词变更,都重放此前的电话会

一个有用的稳健性测试,是把模型与一些简单的基准作对比,比如标题情绪、预测修正的变化,以及未经处理的财报后漂移。如果 GPT 抽取这一层没能在这些基准之外提供额外信息,那它就只是徒增复杂度、并没有带来 alpha。

人们通常栽在哪里

  • 对标题过拟合: 模型抓住"需求强劲"之类的措辞就下判断,却不去核对指引是否真的变了
  • 没有基准: 你必须与上一次电话会作对比,而不是孤立地给一份记录打分
  • 没有做行业标准化: 半导体和必需消费品的措辞,含义不同,波动率环境也不同
  • 没有执行纪律: 追隔夜跳空可能把全部优势消耗殆尽
  • 没有版本管理: 如果改动提示词会显著改变排序结果,说明你的流程还不稳定

最佳适用场景

这套方法最适合作为财报季前后的一套 横截面排序系统 来使用,而不是当作预测单只股票的神谕。alpha 通常来自相对排序、预测的漂移,以及在第一波标题行情之后有纪律的执行。