跳到主要内容

S3 数据 DataX 接入方式

最近更新 2026/10/05

基于DataX的插件:s3reader

需要注意,DataX会将一个作业下同步的所有Object视作同一张数据表。用户必须自己保证所有的Object能够适配同一套schema信息。

示例JSON:


{
"job": {
"setting": {
"speed": {
"byte": 10485760
}
},
"content": [
{
"reader": {
"name": "s3reader",
"parameter": {
"accessKey": "xx",
"secretKey": "xx",
"tempPath": "xxx",
"region": "xxxxx",
"bucket": "xxxxx",
"object": [
"aa/bb/*"
],
"compress": "gzip",
"column": [
{
"type": "string",
"index": 0
}
],
"encoding": "UTF-8",
"fieldDelimiter": "\t"
}
},
"writer": {
"name": "streamwriter",
"parameter": {
"encoding": "",
"print": true
}
}
}
]
}
}

目前S3Reader支持功能如下:

  1. 支持且仅支持读取TXT的文件,且要求TXT中schema为一张二维表。
  2. 支持类CSV格式文件,自定义分隔符。
  3. 支持多种类型数据读取(使用String表示),支持列裁剪,支持列常量
  4. 支持递归读取、支持文件名过滤。
  5. 支持文本压缩,现有压缩格式为zip、gzip、bzip2。注意,一个压缩包不允许多文件打包压缩。
  6. 多个object可以支持并发读取。

参数说明​

  • accessKey

    • 描述:S3的accessKey
    • 必选:是
    • 默认值:无
  • secretKey

    • 描述:S3的secretKey
    • 必选:是
    • 默认值:无
  • region

    • 描述:S3的region
    • 必选:是
    • 默认值:无
  • tempPath

    • 描述:本地缓存的绝对路径
    • 必选:是
    • 默认值:无
    • 容错:无法获取到的objectKey将写在此目录下的FailedFile.txt
  • bucket

    • 描述:S3的bucket
    • 必选:是
    • 默认值:无
  • object

    • 描述:S3的object信息,注意这里可以支持填写多个Object。

    当指定单个S3 Object,S3Reader暂时只能使用单线程进行数据抽取。

    当指定多个S3 Object,S3Reader支持使用多线程进行数据抽取。线程并发数通过通道数指定。

    当指定通配符 * 时,S3Reader 尝试遍历出多个 Object 信息。

    • 必选:是
    • 默认值:无
  • column

    • 描述:读取字段列表,type指定源数据的类型,index指定当前列来自于文本第几列(以0开始),value指定当前类型为常量,不从源头文件读取数据,而是根据value值自动生成对应的列。

    默认情况下,用户可以全部按照String类型读取数据,配置如下:

    "column": ["*"]

    用户可以指定Column字段信息,配置如下:

    "column": [
    {
    "type": "long",
    "index": 0
    },
    {
    "type": "string",
    "value": "alibaba"
    }
    ]

    对于用户指定Column信息,type必须填写,index/value必须选择其一。

    • 必选:是
    • 默认值:全部按照string类型读取
  • fieldDelimiter

    • 描述:读取的字段分隔符
    • 必选:是
    • 默认值:,
  • compress

    • 描述:文本压缩类型,默认不填写意味着没有压缩。支持压缩类型为zip、gzip、bzip2。
    • 必选:否
    • 默认值:不压缩
  • encoding

    • 描述:读取文件的编码配置,目前只支持utf-8/gbk。
    • 必选:否
    • 默认值:utf-8
  • nullFormat

    • 描述:文本文件中无法使用标准字符串定义null(空指针),DataX提供nullFormat定义哪些字符串可以表示为null。

    例如如果用户配置: nullFormat="\N",那么如果源头数据是"\N",DataX视作null字段。

    • 必选:否
    • 默认值:\N
  • skipHeader

    • 描述:类CSV格式文件可能存在表头为标题情况,需要跳过。默认不跳过。
    • 必选:否
    • 默认值:false
  • csvReaderConfig

    • 描述:读取CSV类型文件参数配置,Map类型。读取CSV类型文件使用的CsvReader进行读取,会有很多配置,不配置则使用默认值。
    • 必选:否
    • 默认值:无

常见配置:

"csvReaderConfig":{
"safetySwitch": false,
"skipEmptyRecords": false,
"useTextQualifier": false
}

所有配置项及默认值,配置时 csvReaderConfig 的map中请严格按照以下字段名字进行配置:

boolean caseSensitive = true;
char textQualifier = 34;
boolean trimWhitespace = true;
boolean useTextQualifier = true;//是否使用csv转义字符
char delimiter = 44;//分隔符
char recordDelimiter = 0;
char comment = 35;
boolean useComments = false;
int escapeMode = 1;
boolean safetySwitch = true;//单列长度是否限制100000字符
boolean skipEmptyRecords = true;//是否跳过空行
boolean captureRawRecord = true;

类型转换​

S3本身不提供数据类型,该类型是DataX S3Reader定义:

DataX 内部类型S3 数据类型
LongLong
DoubleDouble
StringString
BooleanBoolean
DateDate

其中:

  • S3 Long是指S3文本中使用整型的字符串表示形式,例如"19901219"。
  • S3 Double是指S3文本中使用Double的字符串表示形式,例如"3.1415"。
  • S3 Boolean是指S3文本中使用Boolean的字符串表示形式,例如"true"、"false"。不区分大小写。
  • S3 Date是指S3文本中使用Date的字符串表示形式,例如"2014-12-31",Date可以指定format格式。
这篇文档对你有帮助吗?