hadoop - Pig có thể xử lý các tệp định dạng ebcdic không? -6ren

hadoop - Pig có thể xử lý các tệp định dạng ebcdic không?

In lại Tác giả: Hồ Xil Thời gian cập nhật: 2023-11-01 15:15:06

25

4

Câu hỏi của tôi rất đơn giản. Pig (Hadoop) có thể xử lý các tệp ebcdic không? Tôi có một số và tôi muốn xử lý và xử lý chúng bằng nền tảng Pig trong Hadoop.

Hiện tại tôi đã lưu tệp và đang cố tải nó như sau:

A = LOAD '/user/enrico/FilesForPigs/IRIS.txt' AS (f1,f2,f3);

Nó có vẻ hoạt động nhưng khi tôi thử nhập: DUMP A; tôi gặp lỗi.

biên tập:

Theo gợi ý của Donald, tôi đang cố gắng tạo một chương trình Java để thực hiện chuyển đổi, cụ thể là tôi đang cố gắng tạo hàm LOAD của riêng mình.

Trên thực tế mã của tôi có vấn đề sau:

@Ghi đè
    công khai inputFormat getInputFormat() {


        trả về TextInputFormat mới();
    }

Đây là ví dụ tôi tìm thấy, nhưng TextInputFormat không phù hợp với trường hợp của tôi. Bạn có biết làm thế nào tôi có thể giải quyết điều này?

Cảm ơn

câu trả lời hay nhất

Không, cơ chế lưu trữ mặc định giả định dữ liệu là ASCII, được phân cách bằng tab. Bạn có thể sử dụng PigStorage(',') Thay đổi dấu phân cách thành dấu phẩy.

Bạn có hai lựa chọn:

Chuyển đổi dữ liệu từ ebcdic sang một số định dạng CSV (bạn có thể thực hiện việc này bằng cách sử dụng một chương trình luồng đơn nếu khối lượng dữ liệu không phải là vấn đề hoặc công việc MapReduce nếu khối lượng dữ liệu có vấn đề)
Viết hàm tải ebcdic tùy chỉnh. Bạn có thể xem cách thực hiện việc này đây .

Có thể ai đó đã triển khai tính năng này nhưng sau khi tìm kiếm nhanh trên Google, tôi không thấy gì cả.

Giới thiệu về hadoop - Pig có thể xử lý các tệp định dạng ebcdic không? , chúng tôi đã tìm thấy một câu hỏi tương tự trên Stack Overflow: https://stackoverflow.com/questions/24869989/

25

4

0

Bài viết khuyến nghị: Regex - Lỗi tạo DDL trong Hive bằng RegexSerDe

Bài viết khuyến nghị: http - Tôi có thể tìm danh sách các giá trị tiêu đề HTTP tiêu chuẩn ở đâu?

Bài viết khuyến nghị: hadoop - Sự cố khi triển khai Giraph

Bài viết khuyến nghị: internet-explorer - Vấn đề tham chiếu http của Internet Explorer

java - 以 Clojure 格式(java.util.Formatter)、cl 格式(Common Lisp 格式)以编程方式控制填充？
有没有办法使用 Clojure format(基于 java.util.Formatter)或 cl-format(基于 Common Lisp 的format) 以编程方式设置空格填充？如果您事先知
java - 在数据库和 postman 上无法看到实际上传的文件(.pdf 格式)格式？
我正在尝试创建一个用户实体以及数据/文件(pdf格式)。上传并保存到数据库很好，但是当我让用户进入 postman 时尝试发送获取请求方法，然后在数据字段中显示一些糟糕的数据，而且我无法在数据库中看到
java - 将字符串转换为 ASCII 格式，然后再转换为 HEX 格式
我必须将值为 {"STX","ETX"} 的普通字符串数组转换为十六进制值，并且我应该根据 http://www.asciitable.com/ 得到 {2,3} . 最佳答案听起来你想要一个 Ma
flutter - dartfmt vs dart 格式 vs flutter 格式
我想格式化我的代码，但不确定哪种格式类型最适合我的项目需要。我发现仅对于 dart 和 flutter 项目(我都有)，有不止一个选项可用于格式化编程语言/框架中预先构建的代码。 Dart : da
excel - 我的 excel 文件是德国(德语)格式，想更改为英语(英国)格式
我已经尝试了多个代码，例如这样 Sub DateFixer() Application.ScreenUpdating = False Application.Calculation =
java - 当我查询 SOLR 时，我希望输出为 csv 格式，但输出仍然为 javabin 格式
SolrQuery query = new SolrQuery(); query.setQuery("*:*"); query.add("wt","csv"); server.query(query)
c++ - 将 QString 日期(RFC 822 格式)转换为另一种基于文化的 QString 格式
我有一个包含多个字符串的数据库，我从查询中获取了这些记录，并且我在 QString 中收到了这种格式的数据: "Mon, 13 Nov 2017 09:48:45 +0000" 所以，我需要根据文化来
xml - 如何在未安装 Excel 的情况下将 DBGrid 导出为 OOXML 格式(Excel 2007/2010 格式)？
我有一个 Delphi 2007 DBGrid，我想让用户以更新的 Excel 格式 (OOXML) 保存它，但我的标准是用户不需要安装 Excel。有没有人知道任何已经这样做的组件？是的，我已经搜索
ruby-on-rails - 在 rails 3.1 中更改 View 格式(提供移动 html 格式，回退到普通 html)
我正在我们的普通 html 站点旁边创建一个移动站点。使用 rails 3.1。移动站点在子域 m.site.com 中访问。我已经定义了移动格式(Mime::Type.register_alias
xmlstarlet 格式
我正在尝试使用 xmlstarlet 格式化 xml 文件，但我不想创建新的 xml 文件。我试过了 xmlstarlet fo --inplace --indent-tab --omit-decl
Excel 格式
我在 A 列中有一个带有文本的电子表格。例如 A1=MY TEXT1 A2=MY TEXT2 A3=MY TEXT3 A4=MY TEXT4 A5=MY TEXT5 我想在文本的前后添加撇号结果是
解析haskell保留注释/格式
我想做一些源代码转换(自动导入列表清理)，我想保留注释和格式。我听说过一些关于解析器这样做的事情，我认为是 ghc 解析器。看起来我可以通过从文件中提取内容来使用 hs-src-exts Langu
用于使值相等的 Excel 格式
我在 Excel 中工作，我想根据另一张表中的列表找出一张表中是否有匹配项。我已将值粘贴到列表中，并希望从另一张表中返回它们的相应值。包含字母和数字的单元格可以正常工作(例如:D5765000)，但
django - DurationField 格式
我有一个 DurationField在我的模型中定义为 day0 = models.DurationField('Duration for Monday', default=datetime.time
wmi - PNPDeviceID 格式
我正在为我的应用程序开发 WMI 查询。它需要为给定的 VID/PID 找到分配的虚拟 COM 端口。使用 WMI Code Creator 我发现...... 命名空间:root\CIMV2 类:W
swift - NSTextList 格式
我试图弄清楚如何使用 NSTextList，但除了 this SO question 之外，在网上几乎没有找到有用的信息。和 the comment in this blog . 使用这个我已经能够创
Oracle last_ddl_time 格式
我要查询all_objects表在哪里last_ddl_time='01 jan 2010'但它拒绝日期格式... 任何机构给我查询的确切格式？最佳答案正如 AKF 所说，您应该使用 Trunc除
Java JEditorPane 格式
我试图在我的应用程序中实现聊天功能。我使用了 2 个 JEditorPane。一个用于保存聊天记录，另一个用于将聊天发送到前一个 JEditorPane。 JEditorPane 是 text/h
assembly - 玩具编译器的输出语言/格式
我在大学里修了一个编译器类(class)，内容非常丰富，很有趣，尽管也很多工作。既然给了我们要实现的语言规范，所以我学不到的一件事就是语言设计。我现在正在考虑创建一种有趣的简单玩具语言，以便我可以玩耍
gradle - Gradle异常的结构/格式
Closed. This question does not meet Stack Overflow guidelines。它当前不接受答案。想改善这个问题吗？更新问题，以便将其作为on-topic

trang đầu

đã học

6Ren·AI

Trung tâm mua sắm

hadoop - Pig có thể xử lý các tệp định dạng ebcdic không?