在同一数据框中迭代比较列值

如何解决在同一数据框中迭代比较列值

我的最终目标是去除重叠的基因。为了做到这一点,我确定了三个条件,但我不会详细介绍它们。如果您需要它们提供替代方法,我可以提及它们。

基本上,我想比较两列的值 (int64)。但是,我想这样做,将单行与所有剩余的行进行比较,如果满足条件,则应按顺序对下一行和其他行执行相同的步骤。

我需要检查数据框中的每一行是否满足给定条件。在此过程中,我需要使用两列(“开始”和“结束”)的值。您可以在下面的伪代码中看到条件之一。

如果满足以下条件,我想删除该行 (DF2.loc[row_loop]) 或创建一个新列并分配一个标签,以便我了解是否存在重叠。然后,我可以删除这些行。

条件:

(rowA ["Start"] >= rowB ["Start"]) and (rowA ["Start"] = rowB ["Start "]) 和 (rowA ["End"] >= rowB ["End"])

这就是我的数据框的样子:

DF2.head()
Chromosome_Name Sequence_Source Sequence_Feature 开始 结束 Strand Gene_ID
0 1 ensembl_havana 基因 14363 34806 - "ENSG00000227232"
1 1 哈瓦那 基因 89295 138566 - "ENSG00000238009"
2 1 哈瓦那 基因 141474 178862 - "ENSG00000241860"
3 1 哈瓦那 基因 227615 272253 - "ENSG00000228463"
4 1 ensembl_havana 基因 312720 453948 + "ENSG00000237094"

这就是我目前所拥有的:

for ref_row in range(0,len(DF2) - 1):
   for row_loop in range(ref_row + 1,len(DF2)):
     if (DF2.loc[ref_row,["Start"]] >= DF2.loc[row_loop,["Start"]]) & (DF2.loc[ref_row,["Start"]] <= DF2.loc[row_loop,["End"]]) & (DF2.loc[ref_row,["End"]] >=  DF2.loc[row_loop,["End"]] >= DF2.loc[row_loop,["End"]]):
        DF2.drop(row_loop)

运行上面的代码后,我得到一个 ValueError,上面写着“只能比较标记相同的系列对象。”

我还用以下内容替换了 if 条件:

DF2["Overlap"] = np.where((DF2.loc[ref_row,["End"]]),np.nan,DF2["Gene_Name"])

但仍然得到相同的 ValueError。

谁能为我提供解决方案或实现我的目标的另一种方法?

提前致谢。

顺便说一句,我很抱歉我的英语。我很难通过写作来解释我的目标,希望你明白。

解决方法

基于您的演示数据和代码:

构建测试数据框(这应该包含在以后的问题中)

DF2 = {
'Chromosome_Name': [1,1,1],'Sequence_Source': ['ensembl_havana','havana','ensembl_havana'],'Sequence_Feature': ['gene','gene','gene'],'Start': [14363,89295,141474,227615,312720],'End': [34806,138566,178862,272253,453948],'Strand': ['-','-','+'],'Gene_ID': ['ENSG00000227232','ENSG00000238009','ENSG00000241860','ENSG00000228463','ENSG00000237094']
}

指定重叠的行

DF2["Overlap"] = False # create column to track overlap
for ref_row in range(0,len(DF2)-1):
    for row_loop in range(ref_row+1,len(DF2)):
        # update overlap to true,does not allow revert to False
        if DF2.loc[ref_row]["Overlap"] != False:
            DF2[ref_row]["Overlap"] = np.where(
                (DF2.loc[ref_row]["Start"] >= DF2.loc[row_loop]["Start"]) & \
                (DF2.loc[ref_row]["Start"] <= DF2.loc[row_loop]["End"]) & \
                (DF2.loc[ref_row]["End"] >=  DF2.loc[row_loop]["Start"]) & \
                (DF2.loc[ref_row]["End"] >= DF2.loc[row_l]["End"])
            )

为了简化,我从条件中删除了 np.nanDF2["Gene_Name"]。使用当前条件,没有发现重叠。您可能希望将条件分解为两部分:

  1. A 在 B 里面吗?
  2. B 在 A 里面吗?

您遇到的错误是由于 .loc 使用不当造成的。

DF2.loc[2,["Start"]]
Out: 
Start    141474
Name: 2,dtype: object

DF2.loc[2]["Start"]
Out: 141474

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。

相关推荐


使用本地python环境可以成功执行 import pandas as pd import matplotlib.pyplot as plt # 设置字体 plt.rcParams[&#39;font.sans-serif&#39;] = [&#39;SimHei&#39;] # 能正确显示负号 p
错误1:Request method ‘DELETE‘ not supported 错误还原:controller层有一个接口,访问该接口时报错:Request method ‘DELETE‘ not supported 错误原因:没有接收到前端传入的参数,修改为如下 参考 错误2:cannot r
错误1:启动docker镜像时报错:Error response from daemon: driver failed programming external connectivity on endpoint quirky_allen 解决方法:重启docker -&gt; systemctl r
错误1:private field ‘xxx‘ is never assigned 按Altʾnter快捷键,选择第2项 参考:https://blog.csdn.net/shi_hong_fei_hei/article/details/88814070 错误2:启动时报错,不能找到主启动类 #
报错如下,通过源不能下载,最后警告pip需升级版本 Requirement already satisfied: pip in c:\users\ychen\appdata\local\programs\python\python310\lib\site-packages (22.0.4) Coll
错误1:maven打包报错 错误还原:使用maven打包项目时报错如下 [ERROR] Failed to execute goal org.apache.maven.plugins:maven-resources-plugin:3.2.0:resources (default-resources)
错误1:服务调用时报错 服务消费者模块assess通过openFeign调用服务提供者模块hires 如下为服务提供者模块hires的控制层接口 @RestController @RequestMapping(&quot;/hires&quot;) public class FeignControl
错误1:运行项目后报如下错误 解决方案 报错2:Failed to execute goal org.apache.maven.plugins:maven-compiler-plugin:3.8.1:compile (default-compile) on project sb 解决方案:在pom.
参考 错误原因 过滤器或拦截器在生效时,redisTemplate还没有注入 解决方案:在注入容器时就生效 @Component //项目运行时就注入Spring容器 public class RedisBean { @Resource private RedisTemplate&lt;String
使用vite构建项目报错 C:\Users\ychen\work&gt;npm init @vitejs/app @vitejs/create-app is deprecated, use npm init vite instead C:\Users\ychen\AppData\Local\npm-
参考1 参考2 解决方案 # 点击安装源 协议选择 http:// 路径填写 mirrors.aliyun.com/centos/8.3.2011/BaseOS/x86_64/os URL类型 软件库URL 其他路径 # 版本 7 mirrors.aliyun.com/centos/7/os/x86
报错1 [root@slave1 data_mocker]# kafka-console-consumer.sh --bootstrap-server slave1:9092 --topic topic_db [2023-12-19 18:31:12,770] WARN [Consumer clie
错误1 # 重写数据 hive (edu)&gt; insert overwrite table dwd_trade_cart_add_inc &gt; select data.id, &gt; data.user_id, &gt; data.course_id, &gt; date_format(
错误1 hive (edu)&gt; insert into huanhuan values(1,&#39;haoge&#39;); Query ID = root_20240110071417_fe1517ad-3607-41f4-bdcf-d00b98ac443e Total jobs = 1
报错1:执行到如下就不执行了,没有显示Successfully registered new MBean. [root@slave1 bin]# /usr/local/software/flume-1.9.0/bin/flume-ng agent -n a1 -c /usr/local/softwa
虚拟及没有启动任何服务器查看jps会显示jps,如果没有显示任何东西 [root@slave2 ~]# jps 9647 Jps 解决方案 # 进入/tmp查看 [root@slave1 dfs]# cd /tmp [root@slave1 tmp]# ll 总用量 48 drwxr-xr-x. 2
报错1 hive&gt; show databases; OK Failed with exception java.io.IOException:java.lang.RuntimeException: Error in configuring object Time taken: 0.474 se
报错1 [root@localhost ~]# vim -bash: vim: 未找到命令 安装vim yum -y install vim* # 查看是否安装成功 [root@hadoop01 hadoop]# rpm -qa |grep vim vim-X11-7.4.629-8.el7_9.x
修改hadoop配置 vi /usr/local/software/hadoop-2.9.2/etc/hadoop/yarn-site.xml # 添加如下 &lt;configuration&gt; &lt;property&gt; &lt;name&gt;yarn.nodemanager.res