内部表和外部表区别和详解
方式一 在linux上传
1.上传student.csv和techer.csv文件到linux上的/opt/hive上
2.使用myhive数据库
3.创建表并将本地文件上传到表中
创建老师表(外部表):
create external table techer (t_id string,t_name string) row format delimited fields terminated by '\t';
创建老师表(内部表):
create table techer (t_id string,t_name string) row format delimited fields terminated by '\t';
创建学生表(外部表):
create external table student (s_id string,s_name string,s_birth string , s_sex string ) row format delimited fields terminated by '\t';
create table student (s_id string,s_name string,s_birth string , s_sex string ) row format delimited fields terminated by '\t';
4.添加数据
load data local inpath '/opt/hive/student.csv' into table student;(从本地添加)
load data inpath '/opt/hive/student.csv' into table student;(从hdfs中添加)
load data local inpath '/export/servers/hivedatas/student.csv' overwrite into table student;(从本地添加并进行覆盖)
load data local inpath '/export/servers/hivedatas/student.csv' overwrite into table student;(从hdfs中添加并进行覆盖)
5.selec * from filename;
drop table student;
(1)将外部表删除后,hdfs中的数据仍然存在,但hive里面表删除,创建表查看时,还会看见原有数据
(2)将内部表删除后,hive里面和hdfs里面数据都会删除
总结:内部表数据由Hive自身管理,外部表数据由HDFS管理;
内部表数据存储的位置是hive.metastore.warehouse.dir(默认:/user/hive/warehouse),外部表数据的存储位置由自己制定;
删除内部表会直接删除元数据(metadata)及存储数据;删除外部表仅仅会删除元数据,HDFS上的文件并不会被删除;
对内部表的修改会将修改直接同步给元数据,而对外部表的表结构和分区进行修改,则需要修复(MSCK REPAIR TABLE table_name;)