如何解决如何向 dask 数据帧中的特定分区添加/追加一行?
我想将一行附加到 dask 数据帧中的特定分区。我尝试了很多方法,但没有一个是可行的。谁可以帮我这个事。提前致谢
我试过了 -
first_partition = df.partitions[0]
new_dd = first_partiton.append(row)
df.partitions[0] = new_dd
这不起作用
我什至尝试使用 map_partitions(),但即使这个函数也不能真正帮助获取分区的元数据来修改特定分区。
是否可以将数据框另存为镶木地板并仅修改特定的镶木地板文件并将其保存回来? - 我试过这个,即使这似乎也不起作用。
解决方法
使用 map_partitions
您可以修改该特定分区。
然后通过切换到延迟对象,将延迟对象替换到列表中,然后切换回dask数据帧来替换数据帧中修改的分区来创建新帧。
def append_row_dict(df,row_dict):
small_df = pd.DataFrame(row_dict)
return df.append(small_df)
p_df = pd.DataFrame({'a':np.arange(0,10)})
dask_df = dd.from_pandas(p_df,npartitions=4)
part_to_change = 1
new_partion = dask_df.get_partition(part_to_change).map_partitions(append_row_dict,{'a':[-1]})
list_of_delayed = dask_df.to_delayed()
## we only have 1 delayed object for 1 partition
assert new_partion.npartitions==1
list_of_delayed[part_to_change]=new_partion.to_delayed()[0]
new_dask_df = dd.from_delayed(list_of_delayed,meta=dask_df._meta)
new_dask_df.get_partition(part_to_change).compute()
a
3 3
4 4
5 5
0 -1
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。