第六部分 · 策略如何变成产品 · 第 45 章
监管、合规和伦理: 技术能力不能越过市场规则
你的下单程序一秒钟能发出几百笔订单,这既是能力,也是责任。量化把交易变快、变自动、变复杂,监管的目光自然跟得更紧。技术能力越强,越不能把市场当成随便试错的 playground:内幕信息、操纵市场、虚假申报、来路不明的数据、失控的算法,任何一样都能把一个研究问题,瞬间升级成法律问题和道德问题。合规不是写在报告末尾的免责声明,而是从系统设计第一天起就要内置的边界。这一章就把这些边界一条一条画清楚。
本部分的问题:不同量化策略赚的是什么钱,承担什么风险,最终怎样装进受约束的产品?
读完后,你能按收益来源和风险结构比较策略,而不是只按历史年化排名。
读完这一章,你会明白
- 交易越自动、速度越快,监管、留痕、风控和合规边界就越不能缺席;机器不会替你把关,把关的永远是规则本身。
- 内幕信息、市场操纵、违规数据和误导销售,是量化四条碰不得的红线,碰一次就可能终结职业生涯。
金融现场 1. 一通电话值几千万美元,也值十一年牢狱
Galleon 对冲基金创始人 Raj Rajaratnam 曾通过关系网络获取多家公司的重大非公开信息。电话里提前听到业绩、交易或董事会消息,下单时看起来只是比市场快了一步;执法机构后来用录音和交易记录把信息流与利润一笔笔接了起来。
这个案例最容易击穿一种自我安慰:只要信息是真的,交易就有本事。金融市场判断的从来不只是“你知不知道”,还包括“你凭什么知道、能不能据此交易”。信号预测力越强,来源越异常,研究者越应该先停下来查它的身份。
量化时代让证据链更完整,而不是更模糊。数据下载记录、聊天、模型版本、下单时间都能被重新拼接。合规不是给策略降速的刹车,它决定了这条收益究竟是可复制的研究成果,还是迟早要被追回的赃款。
2. 监管为什么盯上程序化交易
先想象两种事故的区别。人工交易员手滑下错一笔单,影响大概率止于这一笔;而一段有 bug 的下单程序,可能在几分钟之内把同一个错误复制成几百上千笔,顺着交易通道扩散到整个市场。程序化交易能提高市场效率,这是它的功劳;但机器下单快、频率高、规模大,一旦策略或系统出错,问题扩散的速度也远超人工。所以监管盯着它,不是跟技术过不去,而是盯住四件事:市场公平、交易秩序、系统风险和投资者保护。
这几年,国内对程序化交易的监管要求越来越明确,报告管理、交易监控、异常交易识别、风险控制等都已经摆上桌面。但这里必须泼一盆冷水:具体规则、阈值和口径,要以证监会、交易所和券商的现行原文为准,实盘前还要再确认一次规则的更新时间。本书的概括只是地图,不是法条本身;拿着旧地图走进新街区,是会翻车的。
个人也别抱侥幸心理,觉得自己资金小、没人注意就无所谓。交易所的规则、券商的风控、法律的底线,对你同样生效。技术上的“发得出单”和规则上的“允许发单”,是两道完全不同的门,中间那条缝,就叫合规。
3. 内幕信息和公开信息
假如有人塞给你一份数据,让你比市场上所有人早一步知道某家公司的大事,先别兴奋,第一反应应该是警惕:这东西我能不能用?内幕信息指的是尚未公开、一旦公开可能对证券价格有重大影响的信息。利用内幕信息交易,或者把它泄露给别人,都不是“小聪明”,而是严重违规甚至违法。所以量化研究的数据来源必须合法合规,这是第一道闸门,先于任何模型技巧。
那公开信息是不是就能随便用了?也不是。看得见的网页,不代表你有权抓走它:数据可能有授权限制,爬虫可能违反网站服务条款,个人信息和隐私数据有明确的法律边界,商业数据库更是写死了许可范围。判断一份数据合不合规,要同时问两个问题:能不能拿到?有没有权用?只有前一问,只是技术问题;加上后一问,才是合规问题。
对个人学习者,最稳妥的路线是用公开、合法、授权清楚的数据。一旦有份数据看起来预测力惊人但来源含糊,请把兴奋值先降一半——来源和权限说不清的数据,再强的信号也不能进模型。
一份数据回测效果越好,越要先问三个问题:哪来的、谁授权的、能不能用于投资研究。来源含糊的“神奇数据”,像山里一株格外水灵的蘑菇——越诱人越危险。从研究第一天起,把来源和授权方式写进数据说明,今天看着多余,明天它是你唯一能自证清白的记录。
4. 市场操纵和虚假申报
你挂出一笔买单,市场看到的动作和你心里的意图,有时候根本不是一回事——这正是操纵市场的操作空间。市场操纵指的是用不正当方式影响价格或交易量,误导其他投资者。在程序化交易里尤其要警惕这几类行为:虚假申报、频繁报撤单扰乱市场、拉抬打压、对倒、诱导交易。
有些行为,从代码视角看像个“策略”,从规则视角看就是操纵。典型套路是:大量挂单堆出一个虚假的盘口厚度,从头到尾没打算成交,只为诱导别人跟风交易;等其他人的钱进来把价格推到想要的位置,再闪电撤单、反向成交获利。这不是聪明交易,而是破坏市场秩序——盘口的每一笔挂单,本来都被默认是一份真实的交易意愿,你把它当成了免费的广告牌。
也要说句公道话:合规的做市和高频交易同样会大量撤单,撤单本身不违规。区别在于,它们运行在规则允许的范围内,有真实交易意图,有风险控制。判断一条边界时,别只看代码长什么样,要看四样东西:目的是什么,行为模式是什么,对市场造成了什么影响,规则原文怎么要求。
市场操纵在量化时代最好被抓:你跑掉的每一笔撤单、每一笔得到的成交,都被系统和中介记下。别走到那条线就对了。
虚假的量化处罚不是监管被美味吸住才存在的:撤单率和成交方向永节奏过高的行为,就是一对直接可上罚询企业违规的证据。
5. 数据合规和隐私
“网上能爬到的数据,就是我自己的数据。”——如果团队里有人这么说,你们的法务该加班了。如今的另类数据越来越花哨:新闻、招聘信息、卫星图像、App 使用数据、位置数据、消费数据、社交媒体文本,几乎什么都能变成因子。但数据越丰富,合规问题越重:数据是否授权?是否包含个人信息?是否可用于投资研究?这三个问题在采购(或抓取)之前就要回答,不是出事之后再补。
隐私数据尤其敏感,这里没有任何“收益够不够高”的讨价还价空间。哪怕某份数据真的能预测公司业绩,只要来源侵犯隐私或违反授权,就不能用,用了就是把 Research 变成 Risk。正规的量化机构,数据都要过数据采购、法务、合规和信息安全这几道流程,从来不是研究员想用什么就用什么——这和你们公司上线新依赖前要过安全扫描,是同一套逻辑。
个人做研究,也请从第一天养成三个习惯:保存数据来源,记录授权方式;不抓需要登录或明确禁止爬取的数据;不碰个人敏感信息。这些记录今天看着多余,明天就是你证明清白的唯一证据。
6. 模型留痕和可解释性
设想一个场景:某天收盘后,有人拿着你的实盘记录问——这笔单为什么下?如果你只能挠头说“模型让它买的”,那就麻烦了。实盘策略必须留痕:哪天因为什么下单,用的哪个模型版本,输入数据是什么,参数是什么,风控有没有通过,订单中途有没有被改过,每一项都要能追溯。没有留痕,出了问题既无法复盘,也无法向客户或监管解释——等于一台没有日志的线上服务,挂了都不知道从哪查起。
这里要澄清一个误会:可解释性不等于模型必须简单。复杂模型做不到逐笔解释每个权重,但完全可以通过特征归因、风险暴露、输入输出监控和定期报告,把大方向讲清楚。关键是团队自己心里要有数:这个模型大概在赚什么钱、在承担什么风险。把黑箱当神谕、盈亏全凭信仰,那不叫量化,叫玄学。
反过来,一个模型回测收益很漂亮,但没人知道它为什么买这些股票、是不是依赖某段异常数据、会不会踩穿产品约束——这种模型就不该轻易上线。上线前多问一句“它凭什么”,比上线后写事故报告便宜得多。
7. 模型公平和客户适当性
一双跑鞋合不合脚,要看穿它的人;一个金融产品适不适合卖,要看买它的人。金融产品必须卖给适合的客户:高波动、高杠杆、封闭期长、使用衍生品的产品,天然不适合所有人。适当性管理要求先了解客户的风险承受能力,绝不能因为产品历史收益漂亮,就见人下菜碟、推荐给任何人。收益曲线不会替客户承担亏损,推荐动作才会。
量化机构对外沟通时,同样有几条不能踩的线:不能把回测收益说成实盘收益,不能只截取有利区间展示,不能暗示保本保收益,不能把策略的主要风险藏进脚注。一句话,客户买的是金融产品,不是技术故事——把 PPT 里的夏普比率讲得天花乱坠,掩盖不了风险提示缺位的事实。
个人也不能置身事外。在朋友圈晒收益、公开推荐标的、替别人管钱、收取费用,这些动作每一个都可能触及法律和合规问题。想清楚再发,先问边界再收费——帮朋友理财这件事,友情和执照之间隔着一整套规则。
8. 开源代码和实盘责任
GitHub 上 star 上千的量化策略,clone 下来、接上账户、直接跑?慢着。网上确实有大把量化代码和策略示例,它们非常适合学习,但“能学习”和“能实盘”中间隔着一条河:示例代码往往没处理交易规则、费用、停牌、涨跌停、数据泄漏和风控,也可能本来就只是教学演示。把它直接接上真钱,相当于把教程里的 demo 不加测试就推上生产环境。
用别人的代码,还有一层程序员熟悉、金融圈同样较真的问题:许可证。商业使用允不允许、能不能再发布、是否要署名、数据接口调用有没有额外限制,都要逐条看。计算机行业摸爬滚打出来的开源许可证意识,在金融里克隆一份,一字不用改。
最后也是最硬的一条:实盘责任永远在使用者身上。策略来自网上也好、来自 AI 也好、来自朋友分享也好,亏损之后说“这不是我写的”毫无意义。交易按钮是你按下去的,后果就是你要承担的,市场的账本上没有“转自他人,概不负责”这一栏。
9. AI 生成策略的边界
让大模型十分钟给你写一个双均线策略,它确实写得又快又像样——然后它也可能顺手编一条不存在的交易规则进去。大模型可以帮你写代码、解释概念、生成研究思路,但有一件事它永远做不了:替你承担投资责任。AI 可能编造规则、误解数据口径、写出未来函数、忽略交易成本,金融领域容错率低,尤其不能盲信生成内容。它看起来越自信,你越要当好那个 code reviewer。
正确的姿势是把 AI 当助手,不是当投资经理。它给出的任何策略,都必须走完一整套流水线:数据检查、代码审查、回测验证、样本外测试和风险评估。任何不能解释、不能复现、不能审计的结果,一律不许进实盘——这条门禁规则,对 AI 写的代码和你自己写的代码,应该完全一样严格。
还要防一种更隐蔽的坑:AI 会用教科书般的权威口吻,给出已经过期或干脆错误的监管与市场信息。凡涉及实时规则、费用、监管口径和产品条款的地方,唯一可靠的做法是查官方来源,一行都不能偷懒。
10. 个人交易的合规底线
讲了一圈,落到个人身上,至少要守住这几条底线,建议直接贴在你的显示器边上:不使用内幕信息,不操纵盘口,不诱导他人交易,不违规代客理财,不使用来源不明或无授权的数据,不绕过券商和交易所的规则。这几条每一条都对应着前面讲过的真实代价,不是纸面口号。
如果你在金融机构工作,规则只会更严:员工个人交易规定、信息隔离墙、申报制度和保密义务,一样都躲不开。很多机构对员工买卖证券有严格限制,工作中接触到的信息绝不能往个人账户里带——在公司内网看到的东西,出了会议室就要当自己不知道。
合规听起来处处是限制,但它保护的恰恰是你自己、你的客户和你交易的市场。短期看,违规像一条不用排队的捷径;长期看,它会连本带利毁掉职业和账户。在金融这个行业里,活得久本身就是一种核心竞争力。
11. 把合规写进系统
靠人肉记忆守规矩,就像靠人工盯日志告警——总有一天会困的。合规不能只靠自觉,要沉淀进系统。交易系统里应该有黑名单、限额、权限、日志、审批、异常告警和禁止交易窗口;研究平台里应该有数据权限、版本记录、实验留痕和结果审查。规则长在代码里,才不用每天考验人性。
个人项目不用追求机构级的重装备,做个简化版就够:保存每次实验的配置,记录每条数据的来源,把禁止交易的规则直接写成代码断言,给实盘脚本加上最大订单金额和最大亏损限制两道硬闸,保留完整的交易日志和复盘记录。这些东西加起来,成本不过几天开发,换来的却是系统在替你值夜班。
一旦规则写进系统,你就不再依赖临场自控。金融市场最擅长的就是用情绪和压力让人犯错——大涨时贪婪、大跌时恐惧,手一抖就越界。系统化的边界不会慌张,这正是它最值钱的地方。
人在临场那一下的判断,最贵也最不可靠:大涨时手一抖,自设的限额就成了摆设。所以成熟的做法是把合规和风险切成一小步一小步的系统规诫——黑名单、限额、权限、日志、审批、熔断,每一步都不起眼,串起来就能替你值夜班。别指望关键时刻自己英明,要让错误在结构上根本发不出去。
合规不是看制度距离,是行程距离:把'看规则'变成'跑过的规则'——柴胡值速最近才知道柠惇从哪一边 legisalation 的门槛。
小结
这一章的正文不是让你记住几个孤立名词,而是要把它们放回同一条因果链里。读完后,先用自己的话复述下面几条判断,再顺着“小节回看”检查是否能解释每一步。
- 交易越自动、速度越快,监管、留痕、风控和合规边界就越不能缺席;机器不会替你把关,把关的永远是规则本身。
- 内幕信息、市场操纵、违规数据和误导销售,是量化四条碰不得的红线,碰一次就可能终结职业生涯。
小节回看
- 1. 一通电话值几千万美元,也值十一年牢狱
- 2. 监管为什么盯上程序化交易
- 3. 内幕信息和公开信息
- 4. 市场操纵和虚假申报
- 5. 数据合规和隐私
- 6. 模型留痕和可解释性
- 7. 模型公平和客户适当性
- 8. 开源代码和实盘责任
- 9. AI 生成策略的边界
- 10. 个人交易的合规底线
- 11. 把合规写进系统
自测
程序化交易为什么格外受监管关注?
机器下单速度快、频率高、规模大,一旦系统出错或行为异常,会比人工更快地把冲击扩散到整个市场。
数据公开可见,为什么还要谈合规?
公开看得见不等于你有权抓取、保存、商业使用或拿来做投资研究,授权范围、隐私保护和平台条款都要另外查清。
进入第七部分 · 把研究变成可运行项目
怎样让研究穿过代码、模拟盘、真实订单和人的情绪,仍然保持可信?