最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python 動(dòng)態(tài)遷移solr數(shù)據(jù)過程解析

 更新時(shí)間:2019年09月04日 09:49:33   作者:1066897515  
這篇文章主要介紹了python 動(dòng)態(tài)遷移solr數(shù)據(jù)過程解析,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下

前言

上項(xiàng)目的時(shí)候,遇見一次需求,需要把在線的 其中一個(gè) collection 里面的數(shù)據(jù)遷移到另外一個(gè)collection下,于是就百度了看到好多文章,其中大部分都是使用導(dǎo)入的方法,沒有找到在線數(shù)據(jù)的遷移方法。于是寫了python腳本,分享出來。

思路: collection數(shù)據(jù)量比較大,所以一次性操作所有數(shù)據(jù)太大,于是分段執(zhí)行操作。

先分段 按1000條數(shù)據(jù)量進(jìn)行查詢,處理成json數(shù)據(jù)

把處理后的json數(shù)據(jù) 發(fā)送到目的collection上即可

實(shí)現(xiàn):

一、使用http的接口先進(jìn)行查詢

使用如下格式查詢:

其中:collection_name 是你查詢的collection的名稱

rows 是需要查詢多少行,這里設(shè)置為1000

start 從多少行開始進(jìn)行查詢,待會兒腳本里面就是控制這個(gè)參數(shù)進(jìn)行循環(huán)查詢

http://host:port/solr/collection_name/select?q=*:*&rows=1000&start=0

查詢處理后會得到如下圖片里面的數(shù)據(jù)格式,其中

在response里面,有兩個(gè)鍵值數(shù)據(jù)是我們需要的,一個(gè)是numFound(總的數(shù)據(jù)條數(shù)),docs(所有json數(shù)據(jù)都在這里面)

在docs里面,每條數(shù)據(jù)都帶有version 鍵值,這個(gè)需要給去掉


二、使用http的接口提交數(shù)據(jù)

wt:使用json格式提交

http://host:port/solr/collection_name/update?wt=json

header 需設(shè)置為 {"Content-Type": "application/json"}

提交參數(shù):solr在做索引的時(shí)候,如果文檔已經(jīng)存在,就替換。(這里的參數(shù)也可以直接加到url里面)

{"overwrite":"true","commit":"true"}

data_dict 就是我們處理后的 docs數(shù)據(jù)

提交數(shù)據(jù):data={"add":{ "doc":data_dict}}

三、實(shí)現(xiàn)的腳本如下:

#coding=utf-8
import requests as r
import json
import threading
import time
#發(fā)送數(shù)據(jù)到目的url des_url,data_dict 參數(shù)為去掉version鍵值后的一條字典數(shù)據(jù)
def send_data(des_url,data_dict):
 data={"add":{ "doc":data_dict}}
 headers = {"Content-Type": "application/json"}
 params = {"boost":1.0,"overwrite":"true","&commitWithin":1000,"commit":"true"}
 url = "%s/update?wt=json"%(des_url)
 re = r.post(url,json = data,params=params,headers=headers)
 if re.status_code != 200:
  print("導(dǎo)入出錯(cuò)",data)

#獲取數(shù)據(jù),調(diào)用send_data 發(fā)送數(shù)據(jù)到目的url
def get_data(des_url,src_url):
  #定義起始行
 start = 0
 #先獲取到總的數(shù)據(jù)條數(shù)
 se_data=r.get("%s/select?q=*:*&rows=0&start=%s"%(src_url,start)).text
 se_dict = json.loads(se_data)
 numFound = int(se_dict["response"]["numFound"])
 #while循環(huán),1000條數(shù)據(jù)為一個(gè)循環(huán)
 while start < numFound:
  #定義存放多線程的列表
  th_li = []
    #獲取1000條數(shù)據(jù)
  se_data=r.get("%s/select?q=*:*&rows=1000&start=%s"%(src_url,start)).text
    #把獲取的數(shù)據(jù)轉(zhuǎn)換成字典
  se_dict = json.loads(se_data)
    #獲取數(shù)據(jù)里的docs數(shù)據(jù)
  s_data = (se_dict["response"]["docs"])

  #循環(huán)得到的數(shù)據(jù),刪除 version鍵值,并使用多線程調(diào)用send_data 方法發(fā)送數(shù)據(jù)
  for i in s_data:
   del i["_version_"]
   th = threading.Thread(target=send_data,args=(des_url,i))
   th_li.append(th)

  for t in th_li:
   t.start()
   t.join()

  start += 1000
  print(start)

if __name__ == "__main__":
 #源數(shù)據(jù),查詢數(shù)據(jù)的collection地址
 src_url = "http://ip:port/solr/src_connection"
 #導(dǎo)入數(shù)據(jù)導(dǎo)目的collection 的地址
 des_url = "http://ip:port/solr/des_connection"
 start_time = time.time()
 get_data(des_url,src_url)
 end_time = time.time()
 print("耗時(shí):",end_time-start_time,"秒")

備注:

一、如果你的collection 不在同一個(gè)網(wǎng)絡(luò),不能實(shí)現(xiàn)在線傳輸,可以先把for循環(huán) 刪除了version鍵值的數(shù)據(jù),寫入一個(gè)文件中,然后copy到目的網(wǎng)絡(luò)的服務(wù)器上,循環(huán)讀取文件進(jìn)行上傳,如下寫入文件(這個(gè)就根據(jù)各位大佬的喜好來寫了),但讀取后,需要把每一條數(shù)據(jù)都轉(zhuǎn)換成字典進(jìn)行上傳:

file = open("solr.json","a+")
for i in s_data:
del i["version"]
file.write(str(i)+"\n")
file.close()

二、清除數(shù)據(jù)可使用一下方法,自測比較方便的一種

在你要清除collection里面

選擇 documents

document type 選擇xml

將一下內(nèi)容復(fù)制到如圖位置,最后點(diǎn)擊submit document 按鈕即可

#控制web界面刪除數(shù)據(jù)
<delete><query>:</query></delete>
<commit/>

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • python數(shù)學(xué)建模之三大模型與十大常用算法詳情

    python數(shù)學(xué)建模之三大模型與十大常用算法詳情

    這篇文章主要介紹了python數(shù)學(xué)建模之三大模型與十大常用算法詳情,文章圍繞主題展開詳細(xì)的內(nèi)容介紹,具有一定的參考價(jià)值,感想取得小伙伴可以參考一下
    2022-07-07
  • python?datetime模塊詳解

    python?datetime模塊詳解

    Python中常用于時(shí)間的模塊有time、datetime 和 calendar,顧名思義 time 是表示時(shí)間(時(shí)、分、秒、毫秒)等,calendar 是表示日歷時(shí)間的,本章先討論 datetime 模塊,需要的朋友可以參考下
    2022-06-06
  • python讀取excel表格生成erlang數(shù)據(jù)

    python讀取excel表格生成erlang數(shù)據(jù)

    這篇文章主要為大家詳細(xì)介紹了python讀取excel表格生成erlang數(shù)據(jù),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2017-08-08
  • Python爬蟲之Scrapy環(huán)境搭建案例教程

    Python爬蟲之Scrapy環(huán)境搭建案例教程

    這篇文章主要介紹了Python爬蟲之Scrapy環(huán)境搭建案例教程,本篇文章通過簡要的案例,講解了該項(xiàng)技術(shù)的了解與使用,以下就是詳細(xì)內(nèi)容,需要的朋友可以參考下
    2021-07-07
  • Python中順序結(jié)構(gòu)和循環(huán)結(jié)構(gòu)示例代碼

    Python中順序結(jié)構(gòu)和循環(huán)結(jié)構(gòu)示例代碼

    這篇文章主要介紹了Python中的條件語句和循環(huán)語句,條件語句用于根據(jù)條件執(zhí)行不同的代碼塊,循環(huán)語句用于重復(fù)執(zhí)行一段代碼,文章還詳細(xì)說明了range函數(shù)的使用和continue與break語句的作用,需要的朋友可以參考下
    2025-02-02
  • python的scikit-learn將特征轉(zhuǎn)成one-hot特征的方法

    python的scikit-learn將特征轉(zhuǎn)成one-hot特征的方法

    今天小編就為大家分享一篇python的scikit-learn將特征轉(zhuǎn)成one-hot特征的方法,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-07-07
  • Python3.5面向?qū)ο笈c繼承圖文實(shí)例詳解

    Python3.5面向?qū)ο笈c繼承圖文實(shí)例詳解

    這篇文章主要介紹了Python3.5面向?qū)ο笈c繼承,結(jié)合圖文與實(shí)例形式詳細(xì)分析了Python3.5面向?qū)ο笈c繼承的相關(guān)概念、原理、實(shí)現(xiàn)方法及操作注意事項(xiàng),需要的朋友可以參考下
    2019-04-04
  • np.meshgrid中的indexing參數(shù)問題解決

    np.meshgrid中的indexing參數(shù)問題解決

    本文主要介紹了np.meshgrid中的indexing參數(shù)問題解決,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2023-03-03
  • 用Python實(shí)現(xiàn)二叉樹、二叉樹非遞歸遍歷及繪制的例子

    用Python實(shí)現(xiàn)二叉樹、二叉樹非遞歸遍歷及繪制的例子

    今天小編就為大家分享一篇用Python實(shí)現(xiàn)二叉樹、二叉樹非遞歸遍歷及繪制的例子,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-08-08
  • Keras 使用 Lambda層詳解

    Keras 使用 Lambda層詳解

    這篇文章主要介紹了Keras 使用 Lambda層詳解,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-06-06

最新評論

平远县| 什邡市| 蕲春县| 西吉县| 新泰市| 宾川县| 盐源县| 广水市| 深圳市| 镇安县| 龙川县| 牙克石市| 上高县| 黄龙县| 丰顺县| 汝城县| 安陆市| 常德市| 鹤壁市| 四会市| 广丰县| 保靖县| 北票市| 临沂市| 崇礼县| 永德县| 双桥区| 北辰区| 关岭| 菏泽市| 贵阳市| 会宁县| 吴旗县| 清徐县| 汝阳县| 汉川市| 福泉市| 龙岩市| 新晃| 南通市| 拜泉县|