怎么用Python对高频金融Tick数据进行区间切片与指标计算?

落晨酱_9492

落晨酱_9492

2026-09-08

950人浏览

原创

用pandas.grouper按秒/毫秒分组需设origin='start'确保起点对齐,索引须为时区感知的单调datetimeindex;ohlc中open/close取iloc[0]/iloc[-1],避免first()/last();计算用numba加速,读取用chunksize流式处理。

怎么用python对高频金融tick数据进行区间切片与指标计算?

pandas.Grouper 按秒/毫秒对 datetime 索引做区间分组,别用 resample 直接套

高频Tick数据(如逐笔成交)时间戳精度常达毫秒级,直接用 resample('1S') 容易漏掉跨毫秒边界的切片——resample 默认按日历边界对齐(如整秒起始),而真实交易流是连续到达的。必须用 Grouper 配合 origin='start'origin='epoch' 控制分组起点。

实操建议:

  • 确保 indexpd.DatetimeIndextz-aware(尤其跨时区数据),否则 Grouper 可能静默错位
  • 切片窗口用 freq='100L'(100毫秒)、'500L''1S',注意 L 表示毫秒,ms 也可但 L 更通用
  • 若需“每收到100条就切一片”,改用 groupby(df.index // pd.Timedelta('100L')),避免依赖时间戳绝对值

计算 OHLCV 时,open/close 必须取首尾行,不能用 first()/last()

Tick 数据中同一毫秒内可能有多笔成交(尤其交易所撮合引擎输出),first()last() 按分组内排序取值,但 pandas 默认不保证原始顺序——尤其读取 CSV 后未显式设置 sort_index=False 或未用 df.sort_index() 对齐时间戳。

实操建议:

  • 先执行 df = df.sort_index(),再分组;或读取时加 parse_dates=['time'], index_col='time' 并确认 df.index.is_monotonic_increasingTrue
  • OHLC 中 openiloc[0]['price']closeiloc[-1]['price']high/low/volume 才用 max()/min()/sum()
  • 避免写 .agg({'price': 'first', 'volume': 'sum'})——'first' 在非单调索引下行为不可控

numba.jit 加速滚动统计比 rolling().apply() 快 5–20 倍,但要注意数据连续性

对切片后的时间序列计算 VWAP、移动标准差等指标时,rolling(window=10).apply(lambda x: np.average(x, weights=df.loc[x.index, 'volume'])) 这类操作在百万级 Tick 上会卡死——apply 是纯 Python 循环,且每次调用都触发索引查找。

python-docx
python-docx

python-docx Skill功能概述python-docx Skill是一项面向实际任务的技能,主要用于本Skill提供使用python-docx生成专业Word文档的标准方法和最佳实践;生成安全服务方案文档;核心要点生成技术架构设计文档;生成任何需要专业排版的Word文档;核心库 : python-docx;使用与执行辅助库 : docx.shared , docx.enum , docx.oxml.ns;标准代码模板;1. 文档初始化;2. 字体设置(必须!它将相关步骤、工具调用和结果整理方式集

下载

实操建议:

  • 把价格、成交量转成 numpy.ndarray,用 @numba.jit(nopython=True) 写循环,传入两个数组和窗口大小
  • 确保输入数组无 NaNnumba 不支持 np.nan 运算;预处理用 df.fillna(0) 或剔除
  • 滚动窗口必须是固定长度(rolling(window=20)),变长窗口(如按时间范围)得手动用 searchsorted 定位左右边界

内存爆炸?用 chunksize + yield 流式处理,别一次性 read_csv

单日 A股 Level3 Tick 数据可达 50GB+,pandas.read_csv() 直接加载必然 OOM。即使切片后计算指标,中间 DataFrame 仍含大量冗余字段(如订单号、买卖方向)。

实操建议:

  • 读取时指定 usecols=['time', 'price', 'volume', 'side']dtype={'side': 'category'} 节省内存
  • pd.read_csv(..., chunksize=100000) 分块,每块做完切片+指标后立即 del 掉原始 chunk 引用
  • 关键:不要拼接所有结果到一个大 list,改用 yield 返回生成器,上游用 pd.concat((chunk_result for chunk_result in process_chunks()), copy=False)

高频 Tick 的区间切片不是单纯的时间对齐,本质是重建事件流的观测窗口——起点控制、顺序保障、内存水位,三者缺一不可。最容易被忽略的是索引单调性检查,很多“计算结果跳变”问题其实源于没跑 df.sort_index()

Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

2023.07.20

1551

4

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

2023.07.25

3624

7

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2023.07.31

1549

3

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

2023.08.03

20677

23

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2567

5

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.04

2627

5

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

1063

5

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2023.08.10

576

4

python是前端还是后端
python是前端还是后端

Python属于前端也属于后端,其灵活性和丰富的生态系统使得开发人员能够在不同的领域中灵活运用。本专题为大家提供python相关的文章、下载、课程内容,供大家免费下载体验。

2023.08.11

2023

5

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程