《深入解析sas:数据处理、分析优化与商业应用》一一2.3 通过IMPORT过程读取外部文件数据

简介: 本节书摘来自华章出版社《高并发Oracle数据库系统的架构与设计》一书中的第2章,第2.3节,作者 侯松,更多章节内容可以访问云栖社区“华章计算机”公众号查看 2.3 通过IMPORT过程读取外部文件数据 除了可以通过DATA步读取外部文本文件数据外,SAS还提供了IMPORT过程,通过它可以从外部数据源读取数据并写入SAS数据集中。

本节书摘来自华章出版社《深入解析sas:数据处理、分析优化与商业应用》一书中的第2章,第2.3节,作者 夏坤庄 徐唯 潘红莲 林建伟,更多章节内容可以访问云栖社区“华章计算机”公众号查看

2.3 通过IMPORT过程读取外部文件数据

除了可以通过DATA步读取外部文本文件数据外,SAS还提供了IMPORT过程,通过它可以从外部数据源读取数据并写入SAS数据集中。而且,如果使用SAS/ACCESS to PC Files,IMPORT过程除了可以导入带分隔符的文件外,还可以读取PC文件中的外部数据,包括Microsoft Access数据库文件、Miscrosft Excel工作簿、Lotus 1-2-3文件、dBase文件、JMP文件、SPSS文件、Stata文件、Paradox等。SAS变量的定义根据输入记录确定。
在SAS窗口环境选择菜单“文件”“导入数据”,可以打开“导入”窗口,通过“导入向导”可读取上述类型的数据。导入过程所生成的SAS语句也可以保存起来供以后使用。
对应于IMPORT过程和SAS窗口环境的IMPORT向导,SAS还提供了EXPORT过程和EXPORT向导(选择菜单“文件”“导出数据”),以便将SAS数据集中的数据导出到上述类型的文件。对此这里不做讲解,有兴趣的读者可以通过SAS帮助文档学习。
IMPORT过程的导入数据的基本形式如下:

PROC IMPORT
    DATAFILE=文件名|文件引用 | DATATABLE=表名
    DBMS=数据源标识符
    OUT=数据集名称;
RUN;

其中:
DATAFILE=指定输入文件的完整路径和文件名,或文件引用。文件引用通常通过FILENAME语句指定。
DATATABLE=指定输入DBMS表名。数据源可以通过DATAFILE或DATATABLE指定。
DBMS=指定要导入的数据类型。SAS支持多种数据类型,例如CSV、TAB、ACCESS、XLSX、XLS、EXCEL、JMP、DTA、SPASS等。其中CSV、TAB表示要导入的数据文件分别由逗号和tab符号分隔,ACCESS表示使用LIBNAME语句的Miscrosoft Access表,XLSX表示Micorsoft Excel 2007或2010的工作簿,等等。可参考SAS帮助文档了解关于导入数据类型和各类型的详细信息。
OUT=指定输出的数据集名称。该语句后面还可以添加数据集选项。
下面给出了几个例子,分别讲解通过IMPORT过程导入CSV文件、Microsoft Excel工作簿和Microsoft Access数据库文件中的数据。
1.?读取CSV文件
外部文件contact.csv的内容如下,文件第一行给出了各个数据行中数据值字段的名称,后面的各行则为对应的字段值。

Name,Age,Position,Marriage,Address
Greg William,42,Manager,Single,"14 Bridge St. San Francisco, CA"
Emily Cooker,33,Sales,Married,"42 Rue Marston"
Henry Cooper,,Office,Married,"52 Rue Marston Paris"
Jimmy Cruze,34,Manager,Single,"Box 100 Cary, NC"

使用IMPORT过程导入该文件的代码如下:

proc import out=saslib.contact
    datafile="c:\sas\data\contact.csv"
    dbms=csv replace;
    getnames=yes;
    datarow=2;
run;

proc print data=saslib.contact noobs;
run;

所生成的数据集为saslib逻辑库中的contact数据集,数据文件为c:sasdatacontact.csv,选项DBMS=指定数据库类型为csv。其中文件扩展名可以省略,SAS会根据DBMS=选项指定的据库类型自动加上。
代码中还使用了REPLACE选项,表示当OUT=指定的数据集存在时覆盖该数据集。GETNAMES语句表示是否从该文件中的第一行读取变量值,默认为YES,表示读取;值为NO表示不读取,这时IMPORT过程会自动产生名为F1、F2、F3等的变量。
DATAROW=语句也会经常使用,用于指定IMPORT语句开始读数据的行号。默认情况下,当GETNAMES=NO时,DATAROW=1,当GETNAMES=YES时,DATAROW=2。该选项用于跳过数据文件开始处的多行内容。
PRINT过程打印的数据集内容如图2.47所示。
image

2.?读取Miscosoft Excel工作簿
IMPORT过程可以导入Microsoft Excel工作簿中的数据。在Excel 2007中文件的工作簿pag的内容如图2.48所示。在该图中,共包含了A~E共5列,第一行为字段名称,从第二行开始为数据值。

image

下面使用IMPORT过程读入该工作簿的指定区域。

proc import out=saslib.contact
    datafile="c:\sas\data\contact.xlsx"
    dbms=xlsx replace;
    range='pag$A1:E5'n;
run;

proc print data=saslib.contact noobs;
run;

IMPORT过程中可以使用RANGE=语句指定所导入的区域。在使用IMPORT过程处理工作簿的数据之前,可先通过Microsoft Excel的“名称管理器”定义要处理的数据的区域,在IMPORT过程中,使用RANGE=语句指定该数据区域的名称,或直接在RANGE=语句中指定数据区域。本例中为直接指定,区域为工作簿pag中从A1到E5的矩形区域。PRINT过程打印的数据集的内容如图2.49所示。
image

1)DBMS=XLSX可以处理Microsoft Excel 2007或Microsoft Excel 2010的工作簿。对于其他更早版本的Microsoft Excel生成的工作簿,需使用其他类型,例如XLS、EXCEL4、EXCEL5。
2)还可使用EXCEL数据库类型EXELCS,并通过SAS PC文件服务器来读取相应版本的Excel工作簿。
3)也可以直接使用LIBNAME语句,通过SAS/ACCESS EXCEL引擎来访问Excel工作簿。
具体请参考SAS帮助文档。
通过DBMS=XLS或DBMS=XLSX来读取Excel文件中的数据还有一个好处,即可以直接在UNIX环境下读取Excel工作簿中的数据,不需要访问PC文件服务器。
3.?读取Microsoft Access数据库文件
Microsoft Access是一个桌面关系型数据库系统,通常使用Microsoft ACE引擎(.accdb文件格式)或Microsoft Jet引擎(.mdb文件格式)。在IMPORT过程中指定DBMS为ACCESS,SAS可以读取在Microsoft Access 97、Microsoft Access 2000、Microsoft Access 2003、Microsoft Access 2007和Microsoft Access 2010中的文件。例如:

proc import out=saslib.customer
    datatable='customer'
    dbms=access replace;
    database="c:\sas\data\customer.accdb";
RUN;

在IMPORT过程中使用access数据库类型,实际使用的是SAS/ACCESS LIBNAME引擎。也可以直接使用LIBNAME语句通过SAS/ACCESS ACCESS引擎来访问Microsoft Access数据库文件。这里不做介绍,有兴趣的读者可参考SAS帮助获取更新信息。

相关文章
|
7天前
|
SQL 分布式计算 监控
Sqoop数据迁移工具使用与优化技巧:面试经验与必备知识点解析
【4月更文挑战第9天】本文深入解析Sqoop的使用、优化及面试策略。内容涵盖Sqoop基础,包括安装配置、命令行操作、与Hadoop生态集成和连接器配置。讨论数据迁移优化技巧,如数据切分、压缩编码、转换过滤及性能监控。此外,还涉及面试中对Sqoop与其他ETL工具的对比、实际项目挑战及未来发展趋势的讨论。通过代码示例展示了从MySQL到HDFS的数据迁移。本文旨在帮助读者在面试中展现Sqoop技术实力。
21 2
|
10天前
|
XML JavaScript 前端开发
xml文件使用及解析
xml文件使用及解析
|
15天前
|
存储 缓存 安全
掌握Go语言:Go语言中的字典魔法,高效数据检索与应用实例解析(18)
掌握Go语言:Go语言中的字典魔法,高效数据检索与应用实例解析(18)
|
23天前
|
算法 Linux C++
【Linux系统编程】解析获取和设置文件信息与权限的Linux系统调用
【Linux系统编程】解析获取和设置文件信息与权限的Linux系统调用
29 0
|
18天前
|
存储 缓存 算法
Python中collections模块的deque双端队列:深入解析与应用
在Python的`collections`模块中,`deque`(双端队列)是一个线程安全、快速添加和删除元素的双端队列数据类型。它支持从队列的两端添加和弹出元素,提供了比列表更高的效率,特别是在处理大型数据集时。本文将详细解析`deque`的原理、使用方法以及它在各种场景中的应用。
|
20天前
|
安全 Java 数据安全/隐私保护
【深入浅出Spring原理及实战】「EL表达式开发系列」深入解析SpringEL表达式理论详解与实际应用
【深入浅出Spring原理及实战】「EL表达式开发系列」深入解析SpringEL表达式理论详解与实际应用
43 1
|
25天前
|
设计模式 算法 数据安全/隐私保护
【C++ 引用 】C++深度解析:引用成员变量的初始化及其在模板编程中的应用(二)
【C++ 引用 】C++深度解析:引用成员变量的初始化及其在模板编程中的应用
25 0
【C++ 引用 】C++深度解析:引用成员变量的初始化及其在模板编程中的应用(二)
|
25天前
|
存储 算法 编译器
【C++ 引用 】C++深度解析:引用成员变量的初始化及其在模板编程中的应用(一)
【C++ 引用 】C++深度解析:引用成员变量的初始化及其在模板编程中的应用
35 0
|
5天前
|
SQL API 数据库
Python中的SQLAlchemy框架:深度解析与实战应用
【4月更文挑战第13天】在Python的众多ORM(对象关系映射)框架中,SQLAlchemy以其功能强大、灵活性和易扩展性脱颖而出,成为许多开发者首选的数据库操作工具。本文将深入探讨SQLAlchemy的核心概念、功能特点以及实战应用,帮助读者更好地理解和使用这一框架。
|
14天前
|
负载均衡 算法 Linux
深度解析:Linux内核调度器的演变与优化策略
【4月更文挑战第5天】 在本文中,我们将深入探讨Linux操作系统的核心组成部分——内核调度器。文章将首先回顾Linux内核调度器的发展历程,从早期的简单轮转调度(Round Robin)到现代的完全公平调度器(Completely Fair Scheduler, CFS)。接着,分析当前CFS面临的挑战以及社区提出的各种优化方案,最后提出未来可能的发展趋势和研究方向。通过本文,读者将对Linux调度器的原理、实现及其优化有一个全面的认识。

推荐镜像

更多