Elasticsearch利用scroll查询获取所有数据
Elasticsearch有两种分页方式,一种是通过from和size条件来实现,但是该方法开销比较大,另一种是利用scroll来实现,通过scroll来实现分页获取所有的数据,下面是利用python实现的scroll获取全部数据的方式:
1 from elasticsearch import Elasticsearch 2 3 if __name__ == "__main__": 4 es=Elasticsearch([{"host":"10.120.241.194","port":"9200"}]) 5 query_json={ 6 "match": { 7 "type":3 8 } 9 } 10 queryData = es.search(index='index', scroll='5m', timeout='3s', size=100, body={"query":query_json}) 11 12 mdata = queryData.get("hits").get("hits") 13 if not mdata: 14 print 'empty!' 15 16 scroll_id = queryData["_scroll_id"] 17 total = queryData["hits"]["total"] 18 for i in range(total/100): 19 res = es.scroll(scroll_id=scroll_id, scroll='5m') #scroll参数必须指定否则会报错 20 mdata += res["hits"]["hits"] 21 print res 22 print mdata
通过上面的方法就可以获取es中符合条件的所有记录了。
如果出现{u'index': None, u'reason': {u'reason': u'No search context found for id [303859]', u'type': u'search_context_missing_exception'}这样的问题,是因为代码第19行没有加上scroll参数
【推荐】国内首个AI IDE,深度理解中文开发场景,立即下载体验Trae
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步
· 开发者必知的日志记录最佳实践
· SQL Server 2025 AI相关能力初探
· Linux系列:如何用 C#调用 C方法造成内存泄露
· AI与.NET技术实操系列(二):开始使用ML.NET
· 记一次.NET内存居高不下排查解决与启示
· Manus重磅发布:全球首款通用AI代理技术深度解析与实战指南
· 被坑几百块钱后,我竟然真的恢复了删除的微信聊天记录!
· 没有Manus邀请码?试试免邀请码的MGX或者开源的OpenManus吧
· 园子的第一款AI主题卫衣上架——"HELLO! HOW CAN I ASSIST YOU TODAY
· 【自荐】一款简洁、开源的在线白板工具 Drawnix