业绩指引变化量
Read in English交易管理层措辞的变化,而不只是 EPS 这个标题数字
为什么要做这件事
大多数人对财报的反应都盯着超预期还是不及预期。更好的 alpha 往往来自 管理层这次说的话与上个季度说的话之间的差异。GPT 式抽取之所以有用,是因为它能在大量标的上批量比较语气、细节和指引措辞,而不必把一切压缩成一个粗糙的正负分数。
优势藏在哪里
市场会先给标题数字定价。真正需要更长时间才被定价的,是 预期修正的路径。一家公司可以业绩超预期,却仍然是个糟糕的形态——只要它的需求措辞在恶化、毛利率的表述在软化,或者管理层在回避追问。另一家公司可能小幅不及预期,却成为强势的多头标的——只要指引措辞明显改善,而分析师仍锚定在旧的叙事上。
这就是为什么成熟的财报策略不太关注"超预期还是不及预期",而更关注 对未来路径的预期发生了什么变化.
- 指引漂移: 公司是不是在悄悄给下个季度降低预期?
- 语气的不对称: 准备好的发言很乐观,问答环节却转向谨慎?
- 预期修正的空间: 分析师读完这次电话会后,会上调还是下调预测?
- 横截面排序: 相对同业而言,哪些标的改善得最明显?
信号的组成部分
一个稳健的信号会比较四样东西:
- 本次指引与上次指引
- 本次措辞与上次措辞
- 管理层的表述框架与卖方共识的表述框架
- 准备好的发言与问答环节在语气和细节上的差异
高价值的措辞类别
- 营收展望: 加速、减速、销售漏斗强度、订单量、管线质量
- 利润率: 定价能力、促销力度、产品结构变化、运费、人工、投入成本
- 需求的质感: 企业端的降本增效、宏观上的谨慎、销售周期拉长、渠道库存
- 资本配置: 股票回购、资本开支、招聘、重组、项目时点
- 库存与在手订单: 库存回归正常究竟是利多还是利空,取决于所处行业
结构化抽取的数据结构
强制让输出遵循一个带版本号的数据结构,这样它才可测试、可比较。
{
"revenue_outlook_delta": -2 to 2,
"margin_outlook_delta": -2 to 2,
"capex_intensity_delta": -2 to 2,
"demand_tone_delta": -2 to 2,
"inventory_commentary": "improving | stable | worsening",
"prepared_remarks_score": -2 to 2,
"qa_score": -2 to 2,
"management_credibility": 0 to 1,
"confidence": 0 to 1,
"evidence_spans": ["quote 1", "quote 2"]
}
为什么问答环节值得单列一个字段
准备好的发言是精心打磨过的,问答环节才会暴露压力点。如果管理层照本宣科地重复同一套说辞,但被问到订单时点、库存、渠道健康度或促销力度时开始闪烁其词,这比开场白里那些泛泛的乐观重要得多。
排序与组合逻辑
好的排序引擎会把文本抽取与市场环境结合起来。文本模型负责提出候选标的,排序模型负责判断这笔交易是否仍然值得做。
多头排序的基础输入
- 指引变化量明显为正
- 问答环节得分改善
- 预测修正为正,或正在改善
- 相对成交量偏高
- 跳空幅度还没大到把优势消耗殆尽
空头排序的基础输入
- 需求或利润率的措辞在恶化
- 问答环节明显弱于准备好的发言
- 市场共识仍然过于乐观
- 看似超预期的数字背后,藏着一个看空的形态
简单的综合评分
财报 Alpha =
0.30 * guidance_delta
+ 0.20 * qa_delta
+ 0.15 * margin_delta
+ 0.15 * demand_delta
+ 0.10 * estimate_revision_trend
+ 0.10 * relative_volume_confirmation
重要的不是这些权重的具体数值,而是你要在同一个财报窗口内,把标的与其同业做横截面排序。把它当作一套 最高十分位/最低十分位 的系统来用,效果远好于孤立地押注单只股票。
执行规则
最常见的错误是入场太急,把整个信号的价值都付在了隔夜跳空里。
实用的持仓规则
入场:财报后第 1 天收盘,或第 2 天开盘
持有:5 到 15 个交易日
离场:信号衰减、预期修正反转,或按 ATR/跳空回补设置的止损
组合:排名前 5 的多头、排名前 5 的空头,并做行业标准化
需要回避的情况
- 抛物线式的跳空,行情中最好的一段已经走完
- 流动性差的标的,滑点会盖过预期优势
- 准备好的发言很强、问答环节却明显偏弱的公司
- 同业和供应商的表现,与管理层的乐观说法相互矛盾的标的
最干净的做法通常是等第一波反应结束后再入场,然后在接下来的一到三周里收割预期修正带来的漂移。
验证框架
- 测试 1 日、5 日、10 日和 20 日的前瞻收益
- 对每一次排序都做行业标准化
- 把大幅跳空和小幅跳空分开统计
- 跟踪命中率、平均盈利、平均亏损和换手率
- 每次提示词变更,都重放此前的电话会
一个有用的稳健性测试,是把模型与一些简单的基准作对比,比如标题情绪、预测修正的变化,以及未经处理的财报后漂移。如果 GPT 抽取这一层没能在这些基准之外提供额外信息,那它就只是徒增复杂度、并没有带来 alpha。
人们通常栽在哪里
- 对标题过拟合: 模型抓住"需求强劲"之类的措辞就下判断,却不去核对指引是否真的变了
- 没有基准: 你必须与上一次电话会作对比,而不是孤立地给一份记录打分
- 没有做行业标准化: 半导体和必需消费品的措辞,含义不同,波动率环境也不同
- 没有执行纪律: 追隔夜跳空可能把全部优势消耗殆尽
- 没有版本管理: 如果改动提示词会显著改变排序结果,说明你的流程还不稳定
最佳适用场景
这套方法最适合作为财报季前后的一套 横截面排序系统 来使用,而不是当作预测单只股票的神谕。alpha 通常来自相对排序、预测的漂移,以及在第一波标题行情之后有纪律的执行。