很多人第一次听到“量化”,脑子里容易冒出两个画面:一个是数学天才写了一个模型,然后躺着赚钱;另一个是高频交易系统在毫秒里买进卖出,普通人完全看不懂。
这两个画面都只说中了一小部分。量化真正要做的事情,不是用公式预测未来,而是把一个投资假设写成可以验证、可以执行、可以复盘的规则。
这篇文章只讲知识框架,不构成任何投资建议。
一、一句话理解量化
如果用一句话解释量化,我会这么说:
量化是把投资判断变成数据和规则,再用程序去验证、执行和管理风险。
主观投资也会看公司、行业、估值、情绪和宏观环境。量化不是不看这些东西,而是尽量把它们变成可计算的变量。
比如“这家公司便宜”是一种判断,但机器听不懂。量化会把它拆成市盈率、市净率、现金流收益率、行业分位数、历史分位数等指标。再比如“最近走势很强”,也可以拆成过去 20 天收益率、成交量变化、波动率、相对强弱等特征。
所以,量化不是神秘魔法。它更像一套工程化流程:先提出假设,再找数据,再做验证,再控制风险。
二、量化系统的链路
一个很简化的量化系统,大概可以拆成这几步:
数据
↓
特征 / 因子
↓
策略规则 / 模型
↓
回测
↓
组合构建
↓
交易执行
↓
风控与复盘
每一步都可能出问题。数据错了,后面全错;特征看起来有效,但可能只是碰巧;回测收益很好,也可能是过拟合;交易执行慢一点、手续费高一点,策略就可能从赚钱变成亏钱。
所以量化的核心能力不是“写一个预测涨跌的模型”,而是搭一条可靠链路,让每一个环节都经得起检查。
三、数据:先知道自己在看什么
量化的第一层是数据。常见数据包括:
- 行情数据:价格、成交量、盘口、成交明细;
- 基本面数据:财报、估值、盈利能力、现金流;
- 另类数据:新闻、公告、搜索、卫星图、招聘信息等;
- 交易数据:成交价格、成交量、手续费、滑点、撤单;
- 组合数据:持仓、暴露、收益、回撤、风险指标。
数据看起来越多,越容易产生错觉。真正难的是数据质量:有没有复权,有没有幸存者偏差,财务数据发布日期是不是正确,停牌、退市、涨跌停、交易成本有没有处理。
量化里有一句朴素但很重要的话:垃圾数据进去,垃圾结果出来。
四、因子和策略:把想法变成规则
量化里经常说“因子”。因子可以理解成一种可计算的观察角度。
常见因子包括:
- 价值因子:便宜的资产未来是否更有吸引力;
- 动量因子:过去表现强的资产是否会延续强势;
- 质量因子:盈利稳定、现金流好的公司是否更可靠;
- 低波动因子:波动更低的资产是否有更好的风险调整收益;
- 情绪因子:新闻、资金流、成交拥挤度是否会影响价格。
策略就是把这些因子和规则组合起来。比如先筛掉流动性太差的股票,再按某个因子打分,选前 50 个,控制行业暴露,每月调仓一次。
听起来像一个规则游戏,但真正的难点在于:规则为什么有效?在什么市场环境下有效?什么时候失效?收益来自风险补偿、行为偏差,还是数据挖掘出来的幻觉?
五、回测:最容易让人上头的地方
回测是量化里最让人兴奋,也最危险的一步。你把策略放到历史数据里跑一遍,如果曲线一路向上,很容易觉得自己找到了财富密码。
但回测至少有几个坑:
- 未来函数:用了当时还不知道的数据,比如提前看到了财报;
- 幸存者偏差:只看今天还活着的股票,忽略了退市和失败样本;
- 过拟合:参数调到刚好适配历史,却无法适应未来;
- 交易成本低估:手续费、冲击成本、滑点都算轻了;
- 流动性错觉:历史上看起来能成交,真实交易时不一定买得到或卖得掉;
- 样本太短:只经历过一种市场环境,没有经历完整周期。
所以回测不是证明策略一定赚钱,而是用来排除明显不靠谱的想法。好的回测应该像审讯,不应该像许愿。
六、交易执行:模型之外还有市场摩擦
策略算出来要买什么、卖什么,只是第一步。真正落到市场里,还要考虑怎么成交。
如果订单太大,一次性下出去可能把价格推高或砸低;如果交易太频繁,手续费和滑点会吃掉收益;如果系统延迟高,看到的机会可能已经没了。
这也是为什么监管机构会特别关注算法交易。FINRA 对算法交易的说明里提到,算法策略在市场里更普遍后,对市场和机构稳定性的潜在影响也随之上升;有效的监督与控制需要覆盖风险评估、代码开发、测试验证、交易系统和合规沟通等环节。
这说明量化不是“模型写完就结束”。只要策略会自动生成订单、路由订单或执行交易,它就进入了更严格的系统工程和风控问题。
七、风控:量化系统的刹车
量化策略最怕没有刹车。模型可以错,数据可以断,市场可以变,交易系统也可能出故障。真正重要的是:错的时候损失能不能被限制住。
常见风控包括:
- 仓位限制:单只资产、单个行业、单个策略不能过度集中;
- 回撤控制:亏损达到阈值时降仓或暂停;
- 杠杆控制:避免小波动放大成大风险;
- 流动性控制:避免持有卖不出去的资产;
- 异常监控:价格、成交、订单、延迟、数据源都要监控;
- 人工熔断:系统异常时可以停下来。
量化不是消灭风险,而是尽量把风险显性化、数字化、边界化。
八、量化和机器学习是什么关系
机器学习可以用于量化,但量化不等于机器学习。
很多经典量化策略并不复杂,可能只是排序、打分、回归、组合优化。机器学习更多是在特征很多、关系非线性、数据量较大时,用来帮助建模。
但金融市场和普通机器学习任务不一样。市场分布会变,样本噪声很大,标签本身不稳定,历史规律也可能因为太多人使用而消失。模型越复杂,越需要问一句:它到底学到了可解释的规律,还是只是记住了历史噪声?
所以在量化里,模型能力重要,但风控、数据、交易成本、组合约束、可解释性同样重要。
九、普通人怎么学量化
如果只是想理解量化,我觉得可以按这条路线走:
- 先学金融市场基础:股票、债券、基金、期货、指数、交易规则;
- 再学统计和概率:均值、方差、相关性、回归、假设检验;
- 再学编程和数据处理:Python、pandas、SQL、可视化;
- 再学策略研究:因子、回测、组合、交易成本、风险指标;
- 最后再碰机器学习和自动交易系统。
最好的入门方式,不是上来追求高频、深度学习或复杂模型,而是先做一个很朴素的策略,把从数据到回测到复盘的链路跑通。
十、最后
量化最迷人的地方,是它把很多模糊判断变成了可以讨论的东西:假设是什么,数据从哪来,规则怎么写,历史表现如何,风险在哪里,什么时候应该停止。
但它最容易误导人的地方,也在这里。数字会给人一种确定感,曲线会给人一种安全感,模型会让人以为自己比市场聪明。
所以我更愿意把量化看成一种学习方法:用数据逼自己把假设说清楚,用程序逼自己把规则写清楚,用回测逼自己面对证据,用风控提醒自己承认不确定性。
这大概才是量化真正“量化”的东西:不是未来,而是我们的判断过程。
参考资料
涉及投资和交易的内容,应该以监管机构、交易规则和专业资料为准。本文只是知识梳理,不构成任何投资建议。