理解aarch64汇编函数调用，栈是如何操作的

如何解决理解aarch64汇编函数调用，栈是如何操作的

test.c（裸机）

#include <stdio.h>

int add1(int a,int b)
{
int c;
c = a + b;
return c;
}

int main()
{
int x,y,z;
x = 3;
y = 4;
z = add1(x,y);
printf("z = %d\n",z);
}

我做了 aarch64-none-elf-gcc test.c -specs=rdimon.specs 并且得到了结果。我做了 aarch64-none-elf-objdump -d a.out 并得到了汇编代码。这是主要功能。

00000000004002e0 <add1>:
  4002e0:   d10083ff    sub sp,sp,#0x20       <-- reduce sp by 0x20 (just above it are saved fp and lr of main)
  4002e4:   b9000fe0    str w0,[sp,#12]       <-- save first param x at sp + 12
  4002e8:   b9000be1    str w1,#8]        <-- save second param y at sp + 8
  4002ec:   b9400fe1    ldr w1,#12]       <-- load w1 with x
  4002f0:   b9400be0    ldr w0,#8]        <-- load w0 with y
  4002f4:   0b000020    add w0,w1,w0          <-- w0 = w1 + w0
  4002f8:   b9001fe0    str w0,#28]       <-- store x0 to sp+28
  4002fc:   b9401fe0    ldr w0,#28]       <-- load w0 with the result (seems redundant)
  400300:   910083ff    add sp,#0x20       <-- increment sp by 0x20
  400304:   d65f03c0    ret
0000000000400308 <main>:
  400308:   a9be7bfd    stp x29,x30,#-32]!   <-- save x29(fp) and x30(lr) at sp - 0x20
  40030c:   910003fd    mov x29,sp                 <-- set fp to new sp,the base of stack growth(down)
  400310:   52800060    mov w0,#0x3                    // #3
  400314:   b9001fe0    str w0,#28]           <-- x is assigned in sp + #28
  400318:   52800080    mov w0,#0x4                    // #4
  40031c:   b9001be0    str w0,#24]           <-- y is assiged in sp + #24
  400320:   b9401be1    ldr w1,#24]            <-- load func param for y
  400324:   b9401fe0    ldr w0,#28]           <-- load func param for x
  400328:   97ffffee    bl  4002e0 <add1>           <-- call main1 (args are in w0,w1)
  40032c:   b90017e0    str w0,#20]           <-- store x0(result z) to sp+20
  400330:   b94017e1    ldr w1,#20]           <-- load w1 with the result (why? seems redundant. it's already in w0)
  400334:   d0000060    adrp    x0,40e000 <__sfp_handle_exceptions+0x28>
  400338:   91028000    add x0,x0,#0xa0  <-- looks like loading param x0 for printf
  40033c:   940000e7    bl  4006d8 <printf>
  400340:   52800000    mov w0,#0x0                    // #0 <-- for main's return value..
  400344:   a8c27bfd    ldp x29,[sp],#32  <-- recover x29 and x30 (look's like values in x29,x30 was used in the fuction who called main)
  400348:   d65f03c0    ret
  40034c:   d503201f    nop

我用 <-- 标记添加了我的理解。有人可以看到代码并给我一些更正吗？任何小的评论将不胜感激。（请参阅<main>）

添加：感谢您的评论。我想我忘记问我真正的问题了。在 main 的开始，调用 main 的程序应该把它的返回地址（在 main 之后）放在 x30 中。由于 main 应该调用另一个函数本身，它应该修改 x30，因此它将 x30 保存在其堆栈中。但是为什么它将它存储在 sp - #0x20 中？为什么变量 x,z 存储在 sp + #20,sp + #24,sp + #28 中？如果主函数调用 printf，我猜 sp 和 x29 会减少一些。这个数量取决于被调用的函数（这里是 printf）使用了多少堆栈区域？或者它是恒定的？以及如何确定 main 中的 x29、x30 存储位置？是否确定这两个值位于被调用函数（printf）的堆栈区域上方？抱歉，问题太多。

解决方法

在为 main 布置堆栈时，编译器必须满足以下约束：

x29 和 x30 需要保存在堆栈中。它们每个占用 8 个字节。
局部变量x,y,z需要栈空间，每个4字节。（如果您正在优化，您会看到它们保存在寄存器中，或者完全不存在优化。）这使我们总共有 8+8+4+4+4=28 字节。
栈指针sp必须始终保持16字节对齐；这是架构和 ABI 约束（操作系统可以选择放宽此要求，但通常不会）。所以我们不能只从 sp 中减去 28；我们必须四舍五入到 16 的下一个倍数，即 32。

这就是您提到的 32 或 0x20 的来源。请注意，它完全用于 main 本身使用的堆栈内存。它不是一个普遍的常数；如果您在 main 中添加或删除了足够多的局部变量，您会看到它发生了变化。

它与 printf 的任何需要无关。如果 printf 需要为它自己的局部变量提供堆栈空间，那么 printf 中的代码将不得不相应地调整堆栈指针。编译 main 时的编译器不知道会有多少空间，也不关心。

现在编译器需要在为自己创建的 32 字节堆栈空间内组织这五个对象 x29,x30,x,z。除了以下几点外，选择放在哪里几乎是完全任意的。

该函数的序言需要从堆栈指针中减去 32，并将寄存器 x29,x30 存储在分配空间内的某处。这一切都可以在带有预索引存储对指令 stp x29,[sp,#-32]! 的单个指令中完成。它从 32 中减去 sp，然后将 x29 和 x30 存储在从 sp 现在指向的地址开始的 16 个字节中。所以为了使用这个指令，我们必须接受将 x29 和 x30 放在分配空间的底部，相对于 [sp+0] 和 [sp+8] sp 的 >new 值。将它们放在其他任何地方需要额外的说明并且效率较低。

（实际上，因为这是最方便的方法，所以 ABI 实际上要求以这种方式设置堆栈帧，x29,x30 按此顺序在堆栈上连续，当它们完全使用（5.2.3）。

我们还有从 [sp+16] 开始的 16 个字节可以使用，其中必须放置 x,z。编译器选择将它们分别放在地址 [sp+28],[sp+24],[sp+20] 处。 [sp+16] 处的 4 个字节未使用，但请记住，我们必须在某处浪费 4 个字节才能实现正确的堆栈对齐。安排这些对象的选择，以及哪个插槽不使用，完全是任意的，任何其他安排也一样有效。