第五部分 · 量化行业与策略版图 · 第 12 章

量化行业和个人的路线

从外面看,量化像一群人关在办公室里写神秘算法;真实工作更像一条生产线,研究、工程、交易、风控、合规各司其职,算法只是其中一环。这一章先讲行业里不同角色到底在做什么,帮你看清自己适合站在哪个位置;再给计算机背景的个人一条能真正走通的学习路线:从零起步,该学什么、该做什么、又该避开哪些一开始就注定失败的方向。

读完这一章,你会明白

  • 量化机构是一条研究、数据、工程、交易、风控、合规和运营共同组成的生产线。
  • 公开案例只能帮助理解行业结构,不能当成真实内部 Alpha 来源。
  • 个人量化路线应按金融基础、数据仓库、回测框架、因子报告、模型、模拟盘、小实盘逐步推进。
  • 每个阶段都要有可检查产出,不能只停留在看书或 notebook 曲线。
第 12 章概念路径 1 量化机构不是只有研究员 2 研究员每天在做什 3 量化工程师在做什 4 交易和执行团队在做什么 5 风控和合规不是摆 6 国内常见量化产品线 7 公开案例怎么理解 8 做完才算入门

本图从“量化机构不是只有研究员”走到“做完才算入门”,用于先看第 12 章的关键路径,再回到正文补细节。

1. 量化机构不是只有研究员

一个成熟量化团队通常有多个角色。研究员负责发现信号、做因子和模型、写回测报告。数据工程师负责接入、清洗、校验和维护数据。平台工程师负责研究平台、回测框架、任务调度、存储和权限。交易系统工程师负责订单、执行、券商接口和实盘稳定。

还有组合经理、交易员、风控、合规、运营、产品和客户服务。组合经理决定策略如何组合和分配风险;交易员处理执行和异常;风控盯暴露、回撤、限额和模型失效;合规确保交易和信息使用符合监管;运营负责估值、清算、对账、产品资料。

所以量化不是一个模型训练完就结束。它是研究、数据、工程、交易、风控、合规、运营共同维持的系统。任何一个环节薄弱,都会让策略收益打折,甚至直接造成事故。

2. 研究员每天在做什么

量化研究员的工作不是每天灵感爆发找神奇公式。更多时候是在提出假设、取数据、清洗样本、构造特征、跑回测、看风险、写报告、和已有因子比较、解释失效、重复迭代。

一个典型问题可能是: 某类财务质量指标在中证 1000 里是否有选股效果? 研究员要定义指标,处理公告日期,做行业中性和市值中性,看 IC、分层、换手、成本、容量,再判断它是否能加入现有模型。

研究员还要接受一个现实: 大多数想法最后没用。不是每个因子都有增量,不是每个模型都能上线。好的研究流程会保存失败记录,因为失败能告诉团队哪些方向拥挤、哪些数据有坑、哪些假设站不住。

3. 量化工程师在做什么

量化工程师的价值在于把研究流程和交易流程做成可靠系统。研究员不能每次都手工下载数据、手工拼表、手工跑脚本。工程平台要让数据可追溯、任务可复现、实验可记录、结果可比较。

实盘工程更要求稳定。订单不能重复发,成交不能漏记,风险不能越界,系统异常要告警,发布要回滚,日志要能追溯。金融系统里的 bug 不只是用户体验问题,它会直接变成钱和合规风险。

计算机背景的人进入量化,工程能力是很大优势。但要补金融常识。你写的不是普通推荐系统,而是会下单、会占用资金、会触发监管和客户损益的系统。

4. 交易和执行团队在做什么

交易执行团队负责把目标仓位变成真实成交。它要考虑交易时间、盘口、流动性、冲击成本、涨跌停、停牌、撤单、部分成交、券商通道和执行算法。

对大型机构来说,执行质量会显著影响收益。同一个模型,执行好和执行差可能差出几个百分点。尤其是高换手、小盘股、期货和日内策略,交易成本常常决定策略能不能活。

交易团队还会处理异常。比如某个券商通道延迟升高,某个股票突然停牌,市场急跌导致撤单失败,产品赎回需要减仓。实盘不是实验室,每天都可能有不规则事件。

5. 风控和合规不是摆设

风控负责盯住策略风险是否在边界内。它看回撤、波动、暴露、集中度、杠杆、流动性、压力测试、模型失效和交易异常。合规则负责交易行为、信息使用、产品合同、监管要求和留痕。

量化机构越大,越需要制度化风控。因为资金大了以后,一个错误订单、一个拥挤交易、一个模型失效,影响不只是公司自己,也可能影响市场秩序和客户资产。

国内程序化交易监管近年更强调申报管理、异常交易监控、高频交易报告和风险控制。个人和机构都要明白,量化不是法外之地。技术越强,越要尊重市场规则。

6. 国内常见量化产品线

国内量化私募和公募常见产品包括指数增强、市场中性、CTA、套利、多策略、量化选股、可转债策略等。指数增强是国内非常重要的一类,围绕沪深 300、中证 500、中证 1000 等基准争取超额收益。

市场中性试图对冲市场涨跌,主要赚相对选股收益;CTA 更关注期货趋势、期限结构和跨品种机会;套利策略关注价格关系偏离;多策略平台会把不同收益来源组合起来。

每类产品都有适合和不适合的市场环境。指数增强在市场风格极端时可能跑输,市场中性会受对冲成本和基差影响,CTA 在无趋势震荡里可能难受,套利策略怕极端流动性冲击。没有一种策略永远顺风。

7. 公开案例怎么理解

外界常提到国内量化机构,比如幻方、九坤、启林等。公开资料能看到它们重视数据、模型、算力、工程和多策略平台,但外部不能知道真实 Alpha 细节。学习时可以参考它们的公开介绍,不要把网络传言当内部算法。

幻方公开形象里常和 AI、算力、量化投资联系在一起;九坤、启林等机构也公开展示过量化投资、多资产或科技驱动能力。你能学到的是行业方向: 数据和工程基础设施越来越重要,策略竞争越来越系统化。

国外也有重要案例。骑士资本事件提醒交易系统部署错误会造成巨大损失;文艺复兴、Two Sigma、DE Shaw 等机构提醒量化不是单一模型,而是长期数据、人才、研究和工程积累。但不要神化任何公司,公开信息只能帮助理解行业轮廓。

8. 量化行业现在的形势

近几年量化行业的竞争更激烈。简单因子更拥挤,交易成本和容量更受关注,监管对程序化交易更重视,客户也更关心回撤和风格暴露。只靠一个历史回测漂亮的策略,越来越难获得信任。

同时,数据和算力仍在发展。高频数据、另类数据、文本数据、机器学习、深度学习、组合优化、执行算法都在进步。行业不是没有机会,而是机会越来越要求综合能力。

个人进入这个行业,要少幻想“一个模型打天下”。更现实的能力组合是: 金融基础、统计和机器学习、数据工程、回测和交易系统、风险意识、清晰写报告。

9. 个人量化和机构量化的差别

个人的优势是灵活、成本低、决策快,劣势是数据、资金、交易通道、融券、合规支持和风控资源有限。机构的优势是平台、数据、人才和执行能力,劣势是资金大、容量约束强、流程复杂。

所以个人不应直接模仿机构高频或大规模多因子平台。更合理的是做适合个人规模的研究: 指数基金配置、低频因子验证、基金和 ETF 分析、可转债或小规模策略研究、风险管理工具。

个人量化的目标也不一定是打败所有机构。它可以是理解市场、建立纪律、辅助投资决策、训练工程和研究能力。用小资金把流程做完整,比用大资金赌一个半懂不懂的模型更有价值。

10. 你该怎样看招聘要求

量化研究岗位通常看数学、统计、机器学习、金融直觉和研究能力。量化开发看工程能力、系统稳定性、数据处理、性能和交易业务理解。数据岗位看数据管道、质量控制、存储计算和可追溯。风控岗位看风险模型、产品理解、监管和沟通。

计算机背景的人如果想进量化,要补的不是一堆证书名词,而是能否用金融问题组织工程项目。比如你能不能写一个点时数据回测,能不能解释未来函数,能不能输出一份因子报告,能不能把订单状态机讲清楚。

面试里,对方常常不是要你背某个模型,而是看你是否知道模型为什么可能失效,数据哪里会泄漏,成本怎么扣,风险如何归因。真正的量化能力是把研究结果放回真实市场。

11. 一条能走通的学习路线

个人学习量化最怕两种极端: 一种是一直看书不动手,另一种是一上来就实盘赌模型。更好的路线是每个阶段都有清楚产出: 先能解释金融概念,再能拿到干净数据,再能写出可复现回测,再能做因子报告,再能做模拟盘,最后才考虑小资金实盘。路线不追求快,追求每一步都能检查。

第一阶段目标不是成为金融专家,而是能听懂市场语言。你要知道货币、通胀、银行、债券、股票、基金、ETF、期货、期权、券商、交易所、A 股规则、指数和基准是什么。

产出可以很简单: 用自己的话写一份金融地图。比如解释钱为什么不是财富、银行为什么会有挤兑、股票代表什么权利、债券价格为什么和利率反着走、ETF 为什么可能折溢价、T+1 对回测有什么影响。

不要急着背全部术语。你真正需要的是机制感。看到一个金融产品,能问现金流是什么、谁拿收益、谁承担风险、价格怎么形成、有没有流动性和杠杆。这个能力比背一百个缩写更重要。

12. 建一个干净的数据小仓库

第二阶段目标是让数据可重复。你可以先选一个小范围,比如沪深 300 或中证 500 的日线数据。字段包括交易日、代码、开高低收、成交量、成交额、复权因子、停牌状态、涨跌停价格、指数成分和行业。

数据仓库不一定复杂,可以从本地 parquet 或 sqlite 开始。关键是字段口径清楚、脚本可重复、原始数据和处理后数据分开、每次更新有日志。不要手工改表,不要让实验依赖某个临时文件。

这一阶段的产出是一份数据说明和几个检查脚本: 缺失率、重复行、价格是否为负、成交量是否异常、停牌日如何表示、复权前后收益是否合理、指数成分是否按日期变化。数据质量不过关,后面模型越复杂越危险。

13. 写一个最小回测框架

第三阶段不要追求功能多,先把最小流程写对。每月最后一个交易日生成信号,下一个交易日调仓,买入目标股票,扣佣金和滑点,处理停牌和涨跌停,记录现金、持仓、成交和净值。

第一个策略可以非常朴素: 买入过去 20 日涨幅最高的 20 只股票,或买入低 PB 的 30 只股票。策略好不好不是重点,重点是回测系统是否尊重时间顺序和交易规则。

这一阶段的产出是一份回测报告模板。里面必须有基准、累计收益、年化收益、最大回撤、波动率、夏普、换手率、交易成本、持仓数量、行业暴露、失败成交数量和样本区间。没有报告模板,研究会变成看曲线凭感觉。

14. 做第一个因子报告

第四阶段选一个因子做完整研究。比如低估值、动量、低波动、质量或股息率。定义因子口径,确定股票池,处理极端值,做行业和市值中性化,计算 IC 和 RankIC,做五分组或十分组回测。

报告里要写清楚: 因子为什么可能有效,数据当时是否可见,因子覆盖率如何,IC 均值和稳定性如何,高分组是否跑赢低分组,扣成本后是否还有收益,在哪些年份失效。

这一阶段训练的是研究纪律。不要只保留漂亮图,也要写失败和怀疑。一个因子如果不行,你也学到了数据处理、检验方法和风险解释。量化研究不是每次都成功,而是每次都能留下可复用经验。

15. 多因子和简单模型

单因子跑通后,可以把多个因子组合起来。先用简单加权或线性模型,再尝试 Ridge、ElasticNet、LightGBM 等。特征不要一开始太多,先用你能解释的估值、质量、动量、波动、流动性和规模。

模型训练要按时间切分,不能随机打乱。要保留样本外,记录每次实验,避免因为试太多模型而过拟合。评价指标以 RankIC、分层收益、扣费后超额、回撤、换手和暴露为主,不要只看训练误差。

这一阶段的产出是一个可复现实验目录: 配置文件、训练脚本、预测文件、回测结果、报告和实验日志。别人拿到你的仓库,应该能知道你用了什么数据、什么参数、跑出了什么结果。

16. 模拟盘

模拟盘不是儿戏,它是从研究到实盘的过渡。模拟盘要按真实时间运行: 每天或每月在固定时间生成信号,用当时数据下模拟订单,记录模拟成交、持仓、净值、成本和日志。

模拟盘能暴露很多回测看不到的问题。数据更新延迟、节假日、停牌、涨跌停、脚本失败、网络问题、忘记运行、信号文件格式变了,都会出现。你会发现交易系统不是一段 notebook,而是一套流程。

这一阶段至少跑三到六个月。不要因为模拟盘短期赚钱就急着上实盘,也不要因为短期亏钱就完全推翻策略。重点是观察真实运行稳定性、信号和回测是否一致、成本假设是否合理。

17. 小资金实盘

小资金实盘的目标不是赚大钱,而是验证真实交易链路。你可以用很小比例资金,手动或半自动执行信号,确认下单、成交、费用、持仓、净值和对账都能跑通。

小实盘期间要保持严格记录。每笔交易为什么发生,预期成交价是多少,实际成交价是多少,滑点多少,是否有未成交,是否违反规则,盘后净值和券商账户是否一致。

只有当系统稳定、你能承受回撤、策略逻辑仍然成立,才考虑慢慢扩大资金。扩大资金也要分阶段,因为资金变大后滑点、容量和心理压力都会变。

常见错误是先学复杂模型,再补交易规则。这样会写出看起来高级但不可交易的策略。正确顺序应是金融机制、数据口径、回测规则、风险指标、简单因子、模型、组合、执行。

深度学习可以放在后面。不是因为它不重要,而是因为如果数据和回测错了,深度学习只会更快过拟合错误。先用简单模型建立基线,再问复杂模型是否真的提供增量。

你有计算机基础,优势在工程实现和模型理解;短板通常在金融口径、交易制度和风险直觉。路线设计要补短板,而不是只强化已经会的部分。

18. 做完才算入门

一个合格入门项目至少包括这些文件: 数据说明、数据检查脚本、因子定义、回测引擎、成本模型、指标计算、结果报告、实验日志、风险说明和复盘记录。

报告里至少要有这些图表: 净值和基准、超额收益、回撤、年度收益、月度收益热力图、IC 时间序列、分层收益、行业暴露、换手率、成本敏感性。图表不是为了好看,而是为了让问题暴露。

代码层面至少要做到可复现。不要把路径、日期和参数写死在 notebook 里。配置、数据、模型、回测和报告分开。今天跑和一个月后跑,同样输入应得到同样结果。

学习量化时,停下来复盘和继续写代码一样重要。如果一个策略回测很好但解释不清,停下来;如果结果对参数极度敏感,停下来;如果扣成本后收益消失,停下来;如果样本外明显崩,停下来。

复盘要问: 数据有没有错? 是否有未来函数? 股票池是否回填? 成交假设是否过于乐观? 收益是否来自单一行业或风格? 换手是否过高? 样本是否太短? 试错次数是否太多?

这些问题会让研究变慢,但会让你少走弯路。量化不是靠兴奋感推进,而是靠可验证流程推进。

本章留下的三件事 留下 1 量化机构是一条研究、数据、工程、交易、风控、合规要检查 留下 2 公开案例只能帮助理解行业结构 留下 3 个人量化路线应按金融基础、数据仓库、回测框架、因要检查

读完第 12 章后,至少要能复述“量化机构是一条研究、数据、工程、交易、风控、合规要检查”这一条判断,再用另外两张卡片检查自己是否真的理解。

小结

这一章的正文不是让你记住几个孤立名词,而是要把它们放回同一条因果链里。读完后,先用自己的话复述下面几条判断,再顺着“小节回看”检查是否能解释每一步。

  • 量化机构是一条研究、数据、工程、交易、风控、合规和运营共同组成的生产线。
  • 公开案例只能帮助理解行业结构,不能当成真实内部 Alpha 来源。
  • 个人量化路线应按金融基础、数据仓库、回测框架、因子报告、模型、模拟盘、小实盘逐步推进。
  • 每个阶段都要有可检查产出,不能只停留在看书或 notebook 曲线。

小节回看

  • 1. 量化机构不是只有研究员
  • 2. 研究员每天在做什么
  • 3. 量化工程师在做什么
  • 4. 交易和执行团队在做什么
  • 5. 风控和合规不是摆设
  • 6. 国内常见量化产品线
  • 7. 公开案例怎么理解
  • 8. 量化行业现在的形势
  • 9. 个人量化和机构量化的差别
  • 10. 你该怎样看招聘要求
  • 11. 一条能走通的学习路线
  • 12. 建一个干净的数据小仓库
  • 13. 写一个最小回测框架
  • 14. 做第一个因子报告
  • 15. 多因子和简单模型
  • 16. 模拟盘
  • 17. 小资金实盘
  • 18. 做完才算入门

自测

量化机构为什么不是只有研究员?

因为策略从数据到实盘需要数据、平台、交易、风控、合规、运营和产品共同支持。

为什么不能根据公开资料推断机构真实算法?

公开资料通常只展示方向和能力,真实 Alpha、数据和执行细节不会公开。

为什么不建议一上来做深度学习策略?

如果金融口径、数据对齐和回测规则没做对,复杂模型只会更快过拟合错误。

第一个因子报告应该包含什么?

因子定义、数据口径、IC、分层收益、成本、换手、风险暴露、失效阶段和解释。