Python結(jié)合Sprak實(shí)現(xiàn)計(jì)算曲線與X軸上方的面積
有n組標(biāo)本(1, 2, 3, 4), 每組由m個(gè)( , , ...)元素( , )組成(m值不定), . 各組樣本的分布 曲線如下圖所示. 通過(guò)程序近似實(shí)現(xiàn)各曲線與oc, cd直線圍成的?積.

思路
可以將圖像分成若干個(gè)梯形,每個(gè)梯形的底邊長(zhǎng)為(Xn+1 - Xn-1),面積為矩形的一半,其面積 = (底邊長(zhǎng) X 高)/2,即S = (Xn+1 - Xn-1) * (Yn+1 + Yn+2),對(duì)于整個(gè)圖形,面積為所有梯形面積之和。
[圖片]求曲線與其下方x軸的面積,本質(zhì)上是一個(gè)求積分的過(guò)程??梢詫?duì)所有點(diǎn)進(jìn)行積分,可以調(diào)用np.tapz(x, y)來(lái)求
代碼
"""Calculate the area between the coordinates and the X-axis
"""
import typing
from pandas import read_parquet
def calc_area(file_name: str) -> typing.Any:
"""?積計(jì)算.
Args:
file_name: parquet?件路徑, eg: data.parquet
Returns:
計(jì)算后的結(jié)果
"""
res = []
# Load data from .parquet
initial_data = read_parquet(file_name)
# Get number of groups
group_numbers = initial_data["gid"].drop_duplicates().unique()
# Loop through the results for each group
for i in group_numbers:
data = initial_data[initial_data["gid"] == i]
data = data.reset_index(drop=True)
# Extract the list of x\y
x_coordinates = data["x"]
y_coordinates = data["y"]
# Calculate area between (x[i], y[i]) and (x[i+1], y[i+1])
rect_areas = [
(x_coordinates[i + 1] - x_coordinates[i])
* (y_coordinates[i + 1] + y_coordinates[i])
/ 2
for i in range(len(x_coordinates) - 1)
]
# Sum the total area
result = sum(rect_areas)
res.append(result)
# Also we can use np for convenience
# import numpy as np
# result_np = np.trapz(y_coordinates, x_coordinates)
return res
calc_area("./data.parquet")或者使用pyspark
"""Calculate the area between the coordinates and the X-axis
"""
import typing
from pyspark.sql import Window
from pyspark.sql.functions import lead, lit
from pyspark.sql import SparkSession
def calc_area(file_name: str) -> typing.Any:
"""?積計(jì)算.
Args:
file_name: parquet?件路徑, eg: data.parquet
Returns:
計(jì)算后的結(jié)果
"""
res = []
# Create a session with spark
spark = SparkSession.builder.appName("Area Calculation").getOrCreate()
# Load data from .parquet
initial_data = spark.read.parquet(file_name, header=True)
# Get number of groups
df_unique = initial_data.dropDuplicates(subset=["gid"]).select("gid")
group_numbers = df_unique.collect()
# Loop through the results for each group
for row in group_numbers:
# Select a set of data
data = initial_data.filter(initial_data["gid"] == row[0])
# Adds a column of delta_x to the data frame representing difference
# from the x value of an adjacent data point
window = Window.orderBy(data["x"])
data = data.withColumn("delta_x", lead("x").over(window) - data["x"])
# Calculated trapezoidal area
data = data.withColumn(
"trap",
(
data["delta_x"]
* (data["y"] + lit(0.5) * (lead("y").over(window) - data["y"]))
),
)
result = data.agg({"trap": "sum"}).collect()[0][0]
res.append(result)
return res
calc_area("./data.parquet")提高計(jì)算的效率
- 可以使用更高效的算法,如自適應(yīng)辛普森方法或者其他更快的積分方法
- 可以在數(shù)據(jù)上進(jìn)行并行化處理,對(duì)pd DataFrame\spark DataFrame進(jìn)行分區(qū)并使用分布式計(jì)算
- 在使用spark的時(shí)候可以為window操作制定分區(qū)來(lái)提高性能
- 以下為與本例無(wú)關(guān)的籠統(tǒng)的提高效率的方法
并行計(jì)算:使用多核CPU或分布式計(jì)算系統(tǒng),將任務(wù)分解成多個(gè)子任務(wù)并行處理。
數(shù)據(jù)壓縮:壓縮大數(shù)據(jù)以減少存儲(chǔ)空間和帶寬,加快讀寫速度。
數(shù)據(jù)分塊:對(duì)大數(shù)據(jù)進(jìn)行分塊處理,可以減小內(nèi)存需求并加快處理速度。
緩存優(yōu)化:優(yōu)化緩存策略,減少磁盤訪問(wèn)和讀取,提高計(jì)算效率。
算法優(yōu)化:使用高效率的算法,比如基于樹的算法和矩陣算法,可以提高計(jì)算效率。
到此這篇關(guān)于Python結(jié)合Sprak實(shí)現(xiàn)計(jì)算曲線與X軸上方的面積的文章就介紹到這了,更多相關(guān)Python Sprak計(jì)算面積內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
Python Sleep休眠函數(shù)使用簡(jiǎn)單實(shí)例
這篇文章主要介紹了Python Sleep休眠函數(shù)使用簡(jiǎn)單實(shí)例,本文直接給出兩個(gè)實(shí)現(xiàn)例子,需要的朋友可以參考下2015-02-02
詳解在Python中創(chuàng)建條形圖追趕動(dòng)畫
動(dòng)畫是使可視化更具吸引力和用戶吸引力的好方法。它幫助我們以有意義的方式展示數(shù)據(jù)可視化。Matplotlib是一個(gè)非常流行的數(shù)據(jù)可視化庫(kù),通常用于數(shù)據(jù)的圖形表示以及使用內(nèi)置函數(shù)的動(dòng)畫。本文將用Matplotlib繪制條形圖追趕動(dòng)畫,需要的可以參考一下2022-03-03
pytorch之torch.nn.Identity()的作用及解釋
這篇文章主要介紹了pytorch之torch.nn.Identity()的作用及解釋,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教2023-08-08
python 申請(qǐng)內(nèi)存空間,用于創(chuàng)建多維數(shù)組的實(shí)例
今天小編就為大家分享一篇python 申請(qǐng)內(nèi)存空間,用于創(chuàng)建多維數(shù)組的實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-12-12
Python數(shù)據(jù)預(yù)處理常用的5個(gè)技巧
大家好,本篇文章主要講的是Python數(shù)據(jù)預(yù)處理常用的5個(gè)技巧,感興趣的同學(xué)趕快來(lái)看一看吧,對(duì)你有幫助的話記得收藏一下2022-02-02
python3中替換python2中cmp函數(shù)的實(shí)現(xiàn)
這篇文章主要介紹了python3替換python2中cmp函數(shù),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2019-08-08
python中將兩組數(shù)據(jù)放在一起按照某一固定順序shuffle的實(shí)例
今天小編就為大家分享一篇python中將兩組數(shù)據(jù)放在一起按照某一固定順序shuffle的實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-07-07
Python演化計(jì)算基準(zhǔn)函數(shù)詳解
這篇文章主要介紹了Python演化計(jì)算基準(zhǔn)函數(shù),非常不錯(cuò),具有一定的參考借鑒價(jià)值,需要的朋友參考下吧,希望能夠給你帶來(lái)幫助2021-10-10
Python基于數(shù)列實(shí)現(xiàn)購(gòu)物車程序過(guò)程詳解
這篇文章主要介紹了Python基于數(shù)列實(shí)現(xiàn)購(gòu)物車程序過(guò)程詳解,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-06-06

