聚宽600策略下载和分类分析
2020—2026年聚宽策略资料库的分类、优点、缺点与实盘陷阱
为什么要整理这批策略?
我手里积累了一批聚宽社区策略资料,时间跨度从2020年到2026年,总计605个文件。里面既有完整交易策略,也有因子研究、工具代码、学习笔记和对其他策略的修改版本。
这些文件最吸引眼球的往往是标题:年化百分之几十、几年十几倍、低回撤、高胜率、可实盘。把它们全部放在一起以后,我更想知道的却不是哪一篇标题最漂亮,而是另外几个问题:
- 聚宽社区这些年主要在研究哪些方向?
- 不同策略的利润到底可能来自哪里?
- 回测中看起来很好的结果,为什么到了实盘经常变样?
- 面对几百份代码,普通研究者应该从哪里开始看?
于是,我把这605份文件做了一次系统分类。本文不评选“最强策略”,也不会根据一张收益曲线推荐任何代码,只讨论这些研究方向本身。

分类方法与局限
我先读取文件名、文章标题和年份目录,再检查核心代码中出现的资产类型、选股字段、调仓方式和交易函数,为每份文件指定一个主分类。
这是为了让统计结果能够阅读,并不意味着一份策略只能属于一个方向。例如“小市值+RSRS择时”既是小市值策略,也是技术择时策略;“机器学习ETF轮动”同时涉及机器学习和ETF。本文会按它最主要的研究对象归入一个类别。
另外还要说明三点:
- 文件数量不等于原创策略数量,其中存在克隆、修改和跨年份重复收录;
- 标题中的年化收益、倍数和回撤没有统一回测条件,不能横向比较;
- 本次分类是资料整理,不是对每一份代码完成独立审计。
| 主分类 | 文件数 | 主要研究对象 |
|---|---|---|
| ETF、基金与多资产轮动 | 100 | ETF、黄金、债券、商品和资产配置 |
| 小市值、微盘与成长选股 | 89 | 市值因子、成长因子和微盘股票池 |
| 趋势、择时与技术分析 | 82 | 均线、MACD、RSRS、波动率和突破 |
| 综合策略及其他 | 141 | 多策略组合、难以单标签概括的策略和其他研究 |
| 红利、价值与基本面 | 61 | 股息、估值、盈利质量和财务指标 |
| 因子研究、框架与工具 | 54 | 因子检验、策略框架、数据处理和研究工具 |
| 涨停、打板与竞价短线 | 39 | 首板、连板、竞价、弱转强和情绪交易 |
| 机器学习与人工智能 | 33 | 回归、树模型、神经网络和强化学习 |
| 行业、主题与风格轮动 | 6 | 行业强弱、主题热点和大小盘风格 |
“综合策略及其他”数量较多,主要是因为很多文件的标题只有收益描述或策略昵称,代码又同时包含多个模块。为了避免仅凭一个通用函数就强行贴标签,我把不能可靠判断主方向的文件保留在这一类。
一、小市值、微盘与成长选股
核心思路
这类策略通常先取得全市场股票,排除ST、停牌、新股、科创板或北交所,再按总市值或流通市值从小到大排序。有些版本会直接买入最小市值股票,另一些则先使用盈利、成长、PEG、ROE、ROA、换手率或波动率进行筛选。
典型结构是:
全市场股票
→ 基础过滤
→ 财务或因子筛选
→ 小市值排序
→ 选取5至20只
→ 每周或每日再平衡
优点
- 逻辑直观,代码容易理解和复现;
- 小市值因子在部分历史阶段具有明显超额收益;
- 横截面股票数量多,便于做因子排序和组合实验;
- 可以叠加盈利、成长、质量和成交过滤,避免完全盲选。
缺点
- 容量非常有限,参与资金增加后容易产生冲击成本;
- 个股风险、退市风险和财务异常风险更高;
- 对ST规则、分红规则和监管政策变化敏感;
- 风格退潮时可能出现大量股票同步下跌;
- 回测中的成交价可能远好于实盘能够得到的价格。
最容易被忽略的问题
很多策略最后都执行“按流通市值升序取前几名”。即使前面放了多个财务因子,最终收益也可能主要来自小市值暴露,而不是前面的复杂公式。研究这类策略,最好增加一组只按市值排序的基准,才能判断复杂因子是否真的提供了增量。
二、ETF、基金与多资产轮动
核心思路
ETF轮动策略通常准备一个候选池,计算过去若干交易日的收益率、均线斜率、波动率、回撤或风险调整后动量,然后选择排名靠前的一个或几个品种。行情转弱时,部分策略会切换到货币、债券或黄金等防守资产。
常见研究方向包括:
- 宽基、行业和跨境ETF动量轮动;
- ETF趋势过滤后再排名;
- RSRS、均线、MACD或波动率择时;
- EPO、风险平价和低相关组合;
- 股票、黄金、债券与商品的多资产配置;
- ETF日内T0和溢价套利研究。
优点
- 单个ETF通常比单只小盘股容量更大;
- 天然分散个股风险;
- 可以覆盖股票、债券、黄金、商品和海外市场;
- 交易标的数量有限,代码和实盘维护相对简单;
- 适合用防守资产构建明确的风险切换机制。
缺点
- 动量策略容易在震荡市频繁左右打脸;
- 候选池和回看周期选择容易产生参数过拟合;
- 跨境ETF可能出现明显溢价,价格涨幅不完全代表净值上涨;
- 不同ETF上市时间不同,长回测容易存在样本不一致;
- 行业ETF和小众ETF成交量不足时,也会产生冲击成本。
回测时必须检查
ETF策略需要特别检查候选品种在回测当时是否已经上市。如果把后来上市的ETF替换成指数历史数据,必须明确这只是理论模拟;如果直接使用今天的ETF池回测过去,还可能引入存续偏差。
三、趋势、择时与技术分析
核心思路
这类策略使用价格和成交量判断市场处于上涨、下跌还是震荡状态。资料中常见的指标包括均线、MACD、RSI、BOLL、KAMA、RSRS、ATR、动量、波动率和K线形态。
技术指标本质上都是对历史价格的不同变换。它们不直接知道未来,只是在尝试判断当前趋势是否仍然延续。
优点
- 不依赖财报口径,适用于股票、指数、ETF和期货;
- 信号可以明确编码,容易执行;
- 在持续趋势行情中可能有效控制持仓方向;
- 可以作为其他选股策略的风险开关。
缺点
- 趋势确认天然滞后;
- 震荡行情容易反复买卖;
- 同一个指标可以产生大量参数组合,很容易挑中历史最优值;
- K线形态如果没有严格定义,研究者很容易事后解释;
- 指标叠加过多并不一定增加信息,可能只是重复描述同一段价格历史。
技术择时最值得关注的不是胜率,而是它能否在减少重大回撤的同时,保留足够多的主升段收益。
四、红利、价值与基本面策略
核心思路
这类策略依据公司的估值、盈利能力、现金流和分红情况选股。常见字段包括PE、PB、股息率、ROE、ROA、ROIC、经营现金流、利润增长和资产负债率。
优点
- 因子通常具有较清楚的经济含义;
- 相比纯价格模型,更容易解释为什么持有一家公司;
- 低估值、高盈利和稳定分红可以形成多维度约束;
- 持仓周期通常较长,换手成本相对较低。
缺点
- 财务数据存在披露延迟,不能用报告期结束日当作可用日期;
- 低估值可能来自经营恶化,而不是市场错价;
- 分红策略可能集中在银行、煤炭、能源等少数行业;
- 历史财务字段可能发生口径调整;
- 单次利润、资产处置和会计变化会扭曲指标。
研究基本面策略时,数据“什么时候被市场知道”比数据属于哪个季度更重要。
五、涨停、打板与竞价短线
核心思路
这类策略围绕涨停板、首板、连板、集合竞价、弱转强、封单、成交量和市场情绪展开。它们通常交易频率高,依赖分钟数据,目标是在短时间内捕捉情绪溢价。
优点
- 信号响应快,资金占用时间可能较短;
- 在情绪强势阶段,收益弹性很高;
- 可以把主观短线经验转化为明确条件;
- 适合研究涨停结构、竞价行为和资金博弈。
缺点
- 对成交价格和排队顺序极端敏感;
- 回测能够买到的涨停股票,实盘可能根本买不到;
- 卖出时又可能遇到跌停无法成交;
- 对分钟数据质量、交易延迟和接口稳定性要求高;
- 策略容量通常很小,收益衰减速度可能很快;
- 一两笔无法成交就可能让实盘路径与回测完全分叉。
这类策略不能只看收益曲线。首先要问的是:信号出现后,现实中是否真的存在可成交的对手盘?
六、机器学习与人工智能
核心思路
资料中出现了线性回归、SVR、随机森林、XGBoost、聚类、LSTM、神经网络和DQN强化学习等方法。机器学习策略通常将价格、财务、技术指标和因子数据作为特征,预测未来收益、上涨概率或股票排名。
优点
- 可以处理大量特征及非线性关系;
- 适合做横截面排序、分类和因子组合;
- 能使用滚动训练适应数据变化;
- 可以为传统规则策略提供新的研究工具。
缺点
- 极易发生训练集和测试集泄漏;
- 金融样本并不像图片数据那样独立同分布;
- 模型复杂后很难判断利润来自真实规律还是噪声;
- 特征、窗口、标签和超参数都可能被反复调优;
- 社区示例代码经常只展示一个成功结果,没有完整的样本外验证。
最低限度的验证要求
机器学习策略至少应采用按时间顺序的训练、验证和测试,不能随机打乱未来与过去;标准化、缺失值处理和特征选择也必须只在训练窗口内完成。最终还要进行滚动样本外测试,而不是只报告一次训练结果。
七、因子研究、框架和工具
这部分并不一定直接给出买卖策略,却可能比一条高收益代码更有长期价值,包括:
- 因子IC和分层收益检验;
- 多因子合成与回归;
- 策略框架和子账户分仓;
- 数据清洗、股票池和候选池工具;
- 归因分析、相关性和组合优化;
- 回测加速与调试工具。
它们的优点是可以重复用于不同策略,帮助研究者建立自己的验证流程。缺点是工具本身也可能包含口径错误,如果没有测试,错误会被复制到所有后续策略中。
八、行业、主题与风格轮动
这类策略先判断行业、概念或大小盘风格强弱,再选择对应ETF或行业中的强势股票。它们试图捕捉资金在板块之间迁移的过程。
优点是能够顺应市场主线,减少在弱势行业中逆势选股;缺点是行业分类、成分股变化和热点持续时间都不稳定。主题和概念数据如果使用今天的成分回测过去,还可能引入严重的历史成分偏差。
为什么标题中的高收益不能直接相信?
回测条件不统一
一篇文章使用2015年至2024年,另一篇只使用最近两年;一篇按真实佣金计算,另一篇滑点为零。即使两者都写“年化80%”,也不是同一尺度。
成交模型过于理想
高频、小市值和涨停策略尤其容易受到影响。回测通常只知道某个价格出现过,却不知道当时排队在你前面的订单有多少,也不知道你的资金量会不会推动价格。
参数是看完历史以后选出来的
如果研究者尝试了几十个周期、阈值和持仓数量,最后只展示最好的一组,那么最终曲线已经包含了选择偏差。
重复策略制造了“证据很多”的错觉
资料库中存在相同代码跨年份重复收录,也存在一个原始策略被多次修改和换标题。如果多个相似版本都表现不错,并不等于获得了多个独立证据。
从回测到实盘,收益会在哪里损耗?
理论信号收益
↓ 扣除手续费和印花税
↓ 扣除买卖价差与滑点
↓ 扣除冲击成本
↓ 处理停牌、涨停和跌停
↓ 处理数据延迟和程序异常
↓ 处理资金容量与成交失败
真实可执行收益
策略越依赖小市值、分钟数据、涨停和高换手,上述损耗通常越明显。相反,低换手、流动性较好的ETF或大盘股票策略,回测到实盘的差距通常更容易控制,但仍不能忽略。
我认为正确的阅读顺序
面对几百份策略,不建议按照标题收益从高到低阅读。更有效的顺序是:
- 先阅读策略初始化,确认标的、基准、费用和运行时间;
- 找到股票池或ETF池,判断是否使用了今天才知道的成分;
- 阅读信号计算,确认使用的数据日期;
- 阅读买卖函数,检查涨跌停、停牌和无法成交;
- 统计换手率、持仓数量和单只股票资金占比;
- 查看策略在不同年份和不同市场环境中的表现;
- 修改参数做敏感性测试,而不是只保留最优点;
- 最后才看年化收益和累计倍数。
一套值得继续研究的策略,不一定拥有最高收益,但它的逻辑应该可以解释、参数附近应该仍然有效、成交应该现实,并且在不利区间能够明确说明风险来自哪里。
策略代码资料下载
我将本次整理的605个策略和研究文件按原年份目录打包,文件中原有的标题、作者和来源链接保持不变。
这些代码主要来自聚宽社区公开文章,版权归相应原作者所有。本次整理不主张原策略代码的著作权,仅供个人学习、代码阅读和回测研究,不建议商业再分发。代码没有经过逐份安全审计,不要未经检查直接用于模拟或实盘。如相关权利人认为文件不适合收录,可以通过本站邮箱联系处理。
总结
这605份资料展示了量化研究中几条反复出现的主线:寻找小市值溢价、追踪ETF和行业趋势、用财务指标筛选公司、用技术信号控制仓位、利用短线情绪交易,以及尝试让机器学习从大量数据中寻找规律。
每个方向都有可能在特定市场环境中有效,也都有非常明确的失效方式。真正值得学习的不是标题里的收益数字,而是代码如何定义数据、如何产生信号、如何模拟成交,以及研究者有没有认真面对策略不利的一面。
把别人的策略跑出一条曲线并不难。知道这条曲线为什么出现、哪里可能失真、换一个时期还能不能存在,才是量化研究真正开始的地方。
本文及下载资料仅用于量化研究和代码学习,不构成任何投资建议。历史回测不代表未来表现,任何策略在实盘中都可能发生亏损。