跳到主要内容

配置 S3 数据源

最近更新 2026/10/05

Amazon S3 (Simple Storage Service) 是亚马逊 AWS 提供的对象存储服务,也是全球最流行的云存储解决方案之一。

使用限制​

目前仅支持以下配置方式:


  • 支持读取 S3 数据源(离线读取),并写入 AE 预置仓空间表
  • 支持 AE 预置仓空间表 向 S3 写入(离线写入)

注:

  • 暂不支持 S3 向非 AE 预置仓的其他数据库直接写入

支持的字段类型​

文件类型字段类型离线读(Reader)离线写(Writer)

orc

parquet

boolean支持支持
tinyint支持支持
smallint支持支持
integer支持支持
bigint支持支持
real支持支持
double支持支持
decimal支持支持
varchar支持支持
char支持支持
varbinary不支持不支持
date支持支持
timestamp支持支持
array支持支持
row支持支持
map支持支持
csvstring支持,可配置单字符列分隔符或 \t(Tab),默认逗号;详见“CSV、Text 文件读取规则”。支持写入,列分隔符默认为逗号;配置项见“CSV、Text 文件写入规则”。
textstring支持,列分隔符按正则表达式解析,默认逗号;详见“CSV、Text 文件读取规则”。支持写入,列分隔符默认为逗号;配置项见“CSV、Text 文件写入规则”。
jsonstring有限支持,仅支持文件分隔符为逗号有限支持,仅支持文件分隔符为逗号

创建 S3 数据源​

在 数据开发平台 - 集成 模块,您可以选择 新增 S3 数据源

数据源配置参数信息

填写数据源所需的配置信息并完成连通性测试后,即可成功创建 S3 数据源。

其中参数名称前带 * 的为必填参数,名称前未带 * 的为可选填参数。

字段名称说明
基本信息
*数据源名称数开平台空间内唯一,必须以字母、数字、下划线组合,且不能以数字和下划线开头
备注选填
数据源配置
不区分环境 / 独立环境配置二选一:「不区分环境」表示 生产环境 与 开发环境 共用一套配置,「独立环境配置」表示双环境独立配置
*EndpointS3 的访问地址
*地域 Region例如 ap-northeast-1
*BucketS3 Bucket 的地址,例如:S3://seatunnel-test
*Access Key访问的 Access Key
*Access Secret访问的 Access Secret
高级配置连接数据库所需的其他高级参数,可自定义填写

其中参数名称前带 * 的为必填参数,名称前未带 * 的为可选填参数。

创建离线同步任务​

根据上述步骤成功 创建 S3 数据源 并测试连通性成功后,您可根据实际场景,配置 S3 离线读取 的任务。

S3 作为数据来源/去向​

数据来源选择 S3,并完成以下相关参数配置:

字段名称说明
*源类型数据来源类型选择 S3
*数据源名称已在数据源管理界面注册的 S3 数据源,下拉可选。
若还未建立相应数据源,可单击 数据源管理 按钮,前往创建 S3 数据源。
*文件路径

通过文件路径读取存储在 S3 对象存储中的文件

  • 文件路径支持 空间参数
  • 文件路径支持 通配符 *(在数据去向路径内暂不支持)
  • 支持查看完整的路径信息,支持数据预览
*文件类型支持 orc,csv,text,parquet,json 类型
高级配置空目录标记成功:开启开关后,当文件目录下为空时,视为任务执行成功

其中参数名称前带 * 的为必填参数,名称前未带 * 的为可选填参数。

数据去向选择 S3,并完成以下相关参数配置:

字段名称说明
数据源数据去向类型选择 S3,并选择已在数据源管理界面注册的 S3 数据源,下拉可选
写入目录

数据写入的 S3 目录,在预置前缀之后填写,不能以 / 开头

  • 写入目录支持 空间参数(点击「插入参数」)
  • 写入目录不支持通配符
  • 可点击「完整路径预览」查看完整的路径信息
文件类型支持 orc,csv,text,parquet,json 类型;选择 csv 或 text 时可配置文件写入规则,见下文「CSV、Text 文件写入规则」
写入模式

默认为「写入目录」,可选:

  • 「写入目录」(Insert Into)
  • 「覆盖目录」(Insert Overwrite):先删除写入目录下的所有文件和子目录,再写入新的数据文件
  • 「存在则报错」(Error If Exist)

CSV、Text 文件读取规则​

作为数据来源时,选择 csv 或 text 文件类型后,展开文件读取规则,配置列分隔符和跳过表头。默认列分隔符为逗号,“跳过表头”默认为“否”;文件包含表头且无需将其作为数据读取时,选择“是”。

  • csv:列分隔符支持单个合法字符,例如逗号、分号或竖线,也可填写 \t 表示 Tab。除 \t 外,不支持多字符分隔符,也不支持双引号、回车或换行作为分隔符。例如,按竖线分列时填写 |,不要填写 \|。
  • text:列分隔符按正则表达式解析,例如 \t 表示 Tab,\s+ 表示连续空白,:: 表示两个连续冒号。按竖线或点号分列时,应分别填写 \| 或 \.,避免将其解释为正则表达式中的特殊符号。

CSV 与 Text 的分隔符处理方式不同。切换文件类型或修改读取规则后,请重新检查数据预览和字段映射。

CSV、Text 文件写入规则​

作为数据去向时,选择 csv 或 text 文件类型后,展开文件写入规则。页面提供列分隔符和跳过表头选项,默认值分别为逗号和“否”。列分隔符输入框最多可填写 8 个字符。

写入配置与读取配置独立,不应将读取侧的正则表达式规则直接套用于写入配置。使用自定义分隔符或调整表头选项后,请先通过手动执行检查输出文件,确认分隔符和表头符合预期,再用于正式同步。

字段映射说明​

完成数据来源和目标端配置后,需建立字段映射关系,系统将按照映射关系将源端字段中的数据自动同步至目标字段中。字段映射关系有三种配置方式:

  • 方式一:自定义选择,选中源表字段,并选择目标表中目标字段
  • 方式二:同名映射,系统会自动为源表和目标表中的同名字段建立映射关系
  • 方式三:同行映射,系统会自动为同行字段建立映射关系

需要注意一个目标字段只能对应一个来源字段

字段类型转换方式

提示

在进行数据同步时,系统会使用 CAST() 函数对源表字段进行转型,尝试将其类型转换成目标字段的类型,如果转型失败,则目标字段的值将会被设置为 NULL

数据类型转换特殊说明

  • √ 表示支持对应类型转换
  • √, null 表示支持对应类型转换,若转换失败则被设置为 NULL
源类型/目标类型ROWARRAYMAPSTRINGBOOLEANTINYINTSMALLINTINTBIGINTFLOATDOUBLEDECIMALBYTESDATETIMESTAMPTIME
ROW√, null
ARRAY√, null
MAP√, null
STRING√√, null√, null√, null√, null√, null√, null√, null√, null√, null√, null√, null
BOOLEAN√, null√
TINYINT√, null√√, null√, null√, null
SMALLINT√, null√, null√√, null√, null
INT√, null√, null√, null√√, null
BIGINT√, null√, null√, null√, null√
FLOAT√, null√√, null√, null
DOUBLE√, null√, null√√, null
DECIMAL√, null√, null√, null√
BYTES√, null√
DATE√, null√√, null
TIMESTAMP√, null√, null√
TIME√, null√

基本信息设置​

最后,您需要设置集成方案的基本信息,包括方案的名称、负责人、集成的同步速率以及备注等。

完成配置后,可以点击 「保存」 按钮完成集成方案的创建。

注:方案名称保存后不允许修改

详情页展示:

离线同步方案挂流​

挂载任务流​

1.进入挂载流程

  • 在集成方案详情页,点击右上角「挂载到任务流」按钮

2.选择任务流

  • 从下拉菜单中选择目标任务流

  • 若需新建任务流:

    • 点击下拉菜单下方的「新建任务流」快捷按钮
    • 或前往「开发」模块创建
  • 提示:如未显示目标任务流,可点击右侧↻刷新按钮

3.创建同步节点

  • 在任务流中新建「离线同步方案」类型节点
  • 该节点将关联当前集成方案,节点执行时即触发对应集成方案的运行

4.完成挂载

  • 点击「创建节点并挂载」完成配置
  • 挂载成功后,可点击「前往任务流」立即查看挂载结果
提示

注:挂载任务流所创建的任务节点处于 尚未发布状态,建议您前往查看任务流,并将该节点发布上线。

解除任务流挂载​

如果您希望解除离线同步方案的任务流挂载,

  • 若该任务流还未发布上线,您可前往该方案挂载的任务流,在 开发模式 删除该「离线同步方案」任务节点即可。
  • 若该任务流已经发布上线,在 开发模式 删除该「离线同步方案」任务节点后,您需要重新发布该任务流,即同步解除了该节点在 生产环境 上的挂载。
这篇文档对你有帮助吗?