进击的荆棘头像
关注
Linux系统——进程概念(下)封面图

Linux系统——进程概念(下)

 💁‍♂️个人主页:进击的荆棘

👇作者其它专栏:

《数据结构与算法》《算法》《C++起始之路》《Linux》


目录

1.冯诺依曼体系结构 

2.操作系统(Operator System)

3.进程

4.命令行参数和环境变量

5.程序地址空间


4.命令行参数和环境变量

4.1基本概念

●环境变量(enironment variables)一般指在操作系统中用来指定操作系统运行环境的一些参数

●如:在编写C/C++代码时,在链接的时候,从来不知道我们所链接的动态静态库在哪里,但是照样可以链接成功,生成可执行程序,原因就是有相关环境变量帮助编译器进行查找

●环境变量通常具有某些特殊用途,还有在系统当中通常具有全局特性

4.2常见环境变量

●PATH:指定命令的搜索路径

●HOME:指定用户的主工作目录(即用户登陆到Linux系统中时,默认的目录)

●SHELL:当前shell,它的值通常是/bin/bash

4.3查看环境变量方法

echo $HOSTNAME //HOSTNAME:本机主机名

测试PATH

1.创建code.c文件

#include <stdio.h>

int main()
{
    printf("hello world!\n");
    return 0;
}

2.对比./hello执行和执行hello执行

3.为什么有些指令可以直接执行,不需要带路径,而自己的二进制程序需要带路径才能执行

4.将自己的程序所在路径加入环境变量PATH中,export PATH=$PATH:hello所在路径

5.对比测试

4.4和环境变量相关的命令

1.echo:显示某个环境变量值

2.export:设置一个新的环境变量

3.env:显示所有环境变量

4.unset:清除环境变量

4.set:显示本地定义的shell变量和环境变量

4-5 环境变量的组织方式

每个程序都会收到一张环境表,环境表是一个字符指针数组,每个指针指向一个以'\0'结尾的环境字符串

4.6通过代码如何获取环境变量(不推荐)

●命令行第三个参数

#include <stdio.h>

int main(int argc, char *argv[], char *env[])
{
    for(int i=0; env[i]; i++){
        printf("%s\n", env[i]);
    }
    return 0;
}

●通过第三方变量environ获取

#include <stdio.h>

int main(int argc, char *argv[])
{
    extern char **environ;
   
    for(int i=0; environ[i]; i++){
        printf("%s\n", environ[i]);
    }
    return 0;
}

libc中定义的全局变量environ指向环境变量表,environ没有包含任何头文件中,所以在使用时要用extern声明

4.7通过系统调用获取或设置环境变量(推荐)

●putenv

●getenv

#include <stdio.h>
#include <stdlib.h>

int main()
{
    printf("%s\n", getenv("PATH"));
    return 0;
}

常用getenv和putenv函数来获取特定的环境变量

4.8环境变量通常是具有全局属性的

●环境变量通常具有全局属性,可以被子进程继承下去

#include <stdio.h>
#include <stdlib.h>

int main()
{
    char *env = getenv("MYENV");
    if(env){
        printf("%s\n", env);    
    }
    return 0;
}

直接查看,发现没有结果,说明该环境变量根本不存在

●到处环境变量

        export MYENV="hello world"

●再次运行程序,发现结果有了!说明:环境变量是可以被子进程继承下去的

5.程序地址空间

5.1研究平台

●kernel 2.6.32

●32位平台

5.2程序地址空间回顾

在学习语言时,像C/C++,会了解到如下空间布局图

用如下代码进行验证

#include <stdio.h>
#include <unistd.h>
#include <stdlib.h>

int g_unval;
int g_val = 100;
int main(int argc, char *argv[], char *env[])
{
    const char *str = "helloworld";
    printf("code addr: %p\n", main);
    printf("init global addr: %p\n", &g_val);
    printf("uninit global addr: %p\n", &g_unval);

    static int test = 10;
    char *heap_mem = (char*)malloc(10);
    char *heap_mem1 = (char*)malloc(10);
    char *heap_mem2 = (char*)malloc(10);
    char *heap_mem3 = (char*)malloc(10);
    
    printf("heap addr: %p\n", heap_mem); //heap_mem(0), &heap_mem(1)
    printf("heap addr: %p\n", heap_mem1); //heap_mem(0), &heap_mem(1)
    printf("heap addr: %p\n", heap_mem2); //heap_mem(0), &heap_mem(1)
    printf("heap addr: %p\n", heap_mem3); //heap_mem(0), &heap_mem(1)

    printf("test static addr: %p\n", &test); //heap_mem(0), &heap_mem(1)
    printf("stack addr: %p\n", &heap_mem); //heap_mem(0), &heap_mem(1)
    printf("stack addr: %p\n", &heap_mem1); //heap_mem(0), &heap_mem(1)
    printf("stack addr: %p\n", &heap_mem2); //heap_mem(0), &heap_mem(1)
    printf("stack addr: %p\n", &heap_mem3); //heap_mem(0), &heap_mem(1)

    printf("read only string addr: %p\n", str);
    for(int i = 0 ;i < argc; i++)
    {
        printf("argv[%d]: %p\n", i, argv[i]);
    }
    for(int i = 0; env[i]; i++)
    {
        printf("env[%d]: %p\n", i, env[i]);
    }
    return 0;
}

结果

$ ./a.out
code addr: 0x40055d
init global addr: 0x601034
uninit global addr: 0x601040
heap addr: 0x1791010
heap addr: 0x1791030
heap addr: 0x1791050
heap addr: 0x1791070
test static addr: 0x601038
stack addr: 0x7ffd0f9a4368
stack addr: 0x7ffd0f9a4360
stack addr: 0x7ffd0f9a4358
stack addr: 0x7ffd0f9a4350
read only string addr: 0x400800
argv[0]: 0x7ffd0f9a4811
env[0]: 0x7ffd0f9a4819
env[1]: 0x7ffd0f9a482e
env[2]: 0x7ffd0f9a4845
env[3]: 0x7ffd0f9a4850
env[4]: 0x7ffd0f9a4860
env[5]: 0x7ffd0f9a486e
env[6]: 0x7ffd0f9a4892
env[7]: 0x7ffd0f9a48a5
env[8]: 0x7ffd0f9a48ae
env[9]: 0x7ffd0f9a48f1
env[10]: 0x7ffd0f9a4e8d
env[11]: 0x7ffd0f9a4ea6
env[12]: 0x7ffd0f9a4f00
env[13]: 0x7ffd0f9a4f13
env[14]: 0x7ffd0f9a4f24
env[15]: 0x7ffd0f9a4f3b
env[16]: 0x7ffd0f9a4f43
env[17]: 0x7ffd0f9a4f52
env[18]: 0x7ffd0f9a4f5e
env[19]: 0x7ffd0f9a4f93
env[20]: 0x7ffd0f9a4fb6
env[21]: 0x7ffd0f9a4fd5
env[22]: 0x7ffd0f9a4fdf

5.3虚拟地址

代码验证

#include <stdio.h>
#include <unistd.h>
#include <stdlib.h>

int g_val = 0;

int main()
{
    pid_t id = fork();
    if(id < 0){
        perror("fork");
        return 0;
    }
    else if(id == 0){ //child
        printf("child[%d]: %d : %p\n", getpid(), g_val, &g_val);
    }else{ //parent
        printf("parent[%d]: %d : %p\n", getpid(), g_val, &g_val);
    }
    sleep(1);
    return 0;
}

输出

//与环境相关,观察现象即可

parent[2995]: 0 : 0x80497d8

child[2996]: 0 : 0x80497d8

可以发现,输出的变量值和地址是一模一样的,因为子进程按照父进程为模板,父子并没有对变量进行任何修改。改动代码后:

#include <stdio.h>
#include <unistd.h>
#include <stdlib.h>

int g_val = 0;
int main()
{
    pid_t id = fork();
    if(id < 0){
        perror("fork");
        return 0;
    }
    else if(id == 0){ //child,⼦进程肯定先跑完,也就是⼦进程先修改,完成之后,⽗进程
再读取
        g_val=100;
        printf("child[%d]: %d : %p\n", getpid(), g_val, &g_val);
    }else{ //parent
        sleep(3);
        printf("parent[%d]: %d : %p\n", getpid(), g_val, &g_val);
    }
    sleep(1);
    return 0;
}

输出结果

//与环境相关,观察现象即可
child[3046]: 100 : 0x80497e8
parent[3045]:0 : 0x80497e8

可以发现,父子进程,输出地址一致,但是变量内容不同。得出如下结论:

●变量内容不同,所以父子进程输出的变量绝对不是同一个变量

●但地址值是一样,说明该地址绝对不是物理地址

●在Linux地址下,这种地址叫做虚拟地址

●在用C/C++语言所看到的地址全部都是寻地址,物理地址,用户一概看不到,由OS统一管理

OS必须负责将虚拟地址转化成物理地址

5-4 进程地址空间

分页&虚拟地址空间

说明:

●从上图可以看出,同一个变量,地址相同,其实是虚拟地址相同,内容不同其实是被映射到了不同的物理地址

5.5虚拟地址内存管理

描述linux下进程的地址空间的所有的信息的结构体是mm_struct(内存描述符)。每个进程只有一个mm_struct结构,在每个进程的task_struct结构中,有一个指向该进程的mm_struct结构体指针。

struct task_struct
{
    /*...*/
        struct mm_struct *mm; //对于普通的⽤⼾进程来说该字段指向他
    的虚拟地址空间的⽤⼾空间部分,对于内核线程来说这部分为NULL。
        struct mm_struct *active_mm; // 该字段是内核线程使⽤的。当
    该进程是内核线程时,它的mm字段为NULL,表⽰没有内存地址空间,可也并不是真正的没有,这是因
    为所有进程关于内核的映射都是⼀样的,内核线程可以使⽤任意进程的地址空间。
    /*...*/
}

可以说,mm_struct结构是对整个用户空间的描述。每一个进程都会有自己独立的mm_struct,这样每一个进程都会有自己独立的地址空间才能互不干扰。下图是由task_struct到mm_struct,进程的地址空间的分布情况:

定位mm_struct文件所在位置和task_struct所在路径是一样的,不过它们所在文件不一样,mm_struct所在文件是mm_types.h 

struct mm_struct
{
    /*...*/
    struct vm_area_struct *mmap;     /* 指向虚拟区间(VMA)链表 */
    struct rb_root mm_rb; /* red_black树 */
    unsigned long task_size;     /*具有该结构体的进程的虚拟地址空间的⼤⼩*/
    /*...*/
    // 代码段、数据段、堆栈段、参数段及环境段的起始和结束地址。
    unsigned long start_code, end_code, start_data, end_data;
    unsigned long start_brk, brk, start_stack;
    unsigned long arg_start, arg_end, env_start, env_end;
    /*...*/
}

既然每个进程都由自己独立的mm_struct,操作系统肯定是要将这么多进程的mm_struct组织起来的。虚拟空间的组织方式有两种:

1.当虚拟区较少时采取单链表,由mmap指针指向这个链表;

2.当虚拟区较多时采取红黑树进行管理,由mm_rb指向这棵树。

linux内核使用vm_area_struct结构来表示一个独立的虚拟内存区域(VMA),由于每个不同质的虚拟内存区域功能和内部机制都不同,因此一个进程使用多个vm_area_struct结构来分别表示不同类型的虚拟内存区域。上面的两种组织方式使用的就是vm_area_struct结构来连接各个VMA,方便进行快速访问。

struct vm_area_struct {
    unsigned long vm_start; //虚存区起始
    unsigned long vm_end; //虚存区结束
    struct vm_area_struct *vm_next, *vm_prev; //前后指针
    struct rb_node vm_rb; //红⿊树中的位置
    unsigned long rb_subtree_gap;
    struct mm_struct *vm_mm; //所属的 mm_struct
    pgprot_t vm_page_prot;
    unsigned long vm_flags; //标志位
    struct {
        struct rb_node rb;
        unsigned long rb_subtree_last;
    } shared;
    struct list_head anon_vma_chain;
    struct anon_vma *anon_vma;
    const struct vm_operations_struct *vm_ops; //vma对应的实际操作
    unsigned long vm_pgoff; //⽂件映射偏移量
    struct file * vm_file; //映射的⽂件
    void * vm_private_data; //私有数据
    atomic_long_t swap_readahead_info;
#ifndef CONFIG_MMU
    struct vm_region *vm_region; /* NOMMU mapping region */
#endif
#ifdef CONFIG_NUMA
    struct mempolicy *vm_policy; /* NUMA policy for the VMA */
#endif
    struct vm_userfaultfd_ctx vm_userfaultfd_ctx;
} __randomize_layout;

更细致的描述:

5.6为什么要有虚拟地址空间

此问题转化为:若程序直接可以操作物理内存会造成什么问题?

早期计算中,要运行一个程序,会将这些程序全部装入内存,程序都是直接运行在内存上的,即程序中访问的内存地址都是实际的物理内存地址。当计算机同时运行多个程序时,必须保证这些程序用到的内存总量要小于计算机实际物理内存的大小。

那当程序同时运行多个程序时,操作系统是如何为这些程序分配内存的?如某台计算机总的内存大小是128M,同时运行两个程序A和B,A需占用内存10M,B需占用内存110M。计算机在给程序分配内存时会采取这样的方法:先将内存中的前10M分配给程序A,接着再从剩余的118中划分处110M分配给程序B。

这种分配方法可以保证程序A和程序B都能运行,但是这种简单的内存分配策略问题很多。

●安全风险

        ▨每个进程都可以访问任意的内存空间,意味着任意一个进程都能去读写系统相关内存区域,若是一个木马病毒,那它就能随意的修改内存空间,让设备直接瘫痪。

●地址不确定

        ▨编译完成后的程序是存放再硬盘上的,当运行的时候,需将程序般到内存当中去运行,若直接使用物理地址的话,我们无法确定内存现在使用到哪里了,即拷贝的实际内存地址每一个运行都是不确定的,如:第一次执行a.out的时候,内存当中一个进程都没有运行,所以搬迁到内存地址是0x00000000,但第二次的时候,内存已经有10个进程再运行,那执行a.out的时候,内存地址就不一定了。

●效率低下

        ▨若直接使用物理内存的话,一个进程就是作为一个整体(内存块)操作的,若出现物理内存不够用的时候,一般的办法是将不常用的进程拷贝到磁盘的交换分区中,好腾出内存但若是物理地址的话,就需要将整个进程一起拷走,这样在内存和磁盘之间拷贝时间太长,效率低下。

当有了虚拟地址空间和分页机制就能解决。

●地址空间和页表是OS创建并维护的。即意味着,凡是像使用地址空间和页表进行映射,也一定要在OS的监管之下来进行访问!也顺便保护了物理内存中的所有合法数据,包括各个进程以及内核的相关有效数据!

●因为有地址空间的存在和页表的映射的存在,我们的物理内存中可以对未来的数据进行任意位置的加载!物理内存的分配和进程的管理就可以做到没有关系,进程管理模块和内存管理模块就完成了解耦合。

        ▨因为有地址空间的存在,所以我们在C、C++语言上new,malloc空间的时候,其实是在地址空间上申请的,物理内存可以甚至一个字节都不给你。而当真正进行对物理地址空间访问的时候,才执行内存的相关管理算法,帮你申请内存,构建页表映射关系(延迟分配),这是由操作系统自动完成的,用户包括进程完全0感知。

●因为页表的映射的存在,出现在物理内存中理论上就可以任意位置加载。它可以将地址空间上的虚拟和物理地址进行映射,在进程视角所有的内存分布都可以是有序的。

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/2501_93697341/article/details/163893445

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--