R 编码 - 用错误的字符保存为 UTF-8(我认为)

格雷格

我有一个文件明确说它是 UTF-8,unix 命令file -i说它被编码为 UTF-8,但是当我将它加载到 R 中时(使用带有 UTF8 编码的 readr),我仍然可以清楚地分辨出多字节字符错了。当我指定“Windows-1252”(基于此图表,我很确定它最初的编码方式)作为编码时,我得到了更多不正确的字符。

我认为发生的事情是有人将这些不正确的字符保存为 UTF-8。有没有办法恢复原文?

以下是通过指定编码进行修复的尝试:

library(curl)
library(readr)
#> 
#> Attaching package: 'readr'
#> The following object is masked from 'package:curl':
#> 
#>     parse_date

text_file <- tempfile()
curl_download("https://dl.dropboxusercontent.com/s/7syikmmiduubsqv/test.txt", text_file)


# Default is UTF-8, other specifications add extra characters
read_lines(text_file)
#> [1] "{Província}"
# read_lines(text_file, locale = locale(encoding = "UTF-8")) # same
read_lines(text_file, locale = locale(encoding = "Windows-1252"))
#> [1] "{ProvÃ<U+0083>­ncia}"
read_lines(text_file, locale = locale(encoding = "latin1"))
#> [1] "{ProvÃ<U+0083>­ncia}"

# Same as equivalent readr code
# readLines(text_file)
# readLines(text_file, encoding = "UTF-8")
# readLines(text_file, encoding = "UTF-8-BOM")
# readLines(text_file, encoding = "Windows-1252")

# Desired text: "{Prov\u00EDncia}"

更新

反向编码(例如Stat545示例)不起作用

iconv(read_lines(text_file), from = "UTF-8", to = "Latin1")
#> [1] "{Província}"
iconv(read_lines(text_file), from = "UTF-8", to = "Windows-1252")
#> [1] "{Província}"
格雷格

好吧,我想有更好的方法来解决这个问题,但在有人发布之前,这里有一个解决方案,可以从网站创建表格并将其替换为文本。

(需要纵梁)


# Create the Debugging table from http://www.i18nqa.com/debug/utf8-debug.html
# UTF-8 characters were interpreted as Windows-1252 and then saved
# as UTF-8
create_utf_crosswalk <- function() {
  # Affects Windows-1252 0x80 - 0xFF (but a few characters aren't in
  # the spec, so  remove them)
  hex_codes <- sprintf("%x", seq(strtoi("0x80"), strtoi("0xFF")))
  hex_codes <- hex_codes[!hex_codes %in% c("81", "8d", "8f", "90", "9f")]

  actual_chars_locale <- vapply(hex_codes, FUN.VALUE = character(1), function(x) {
    parse(text = paste0("'\\x", x, "'"))[[1]]
  })

  actual_chars_utf <- iconv(actual_chars_current, to = "UTF-8")

  mangled_chars_utf <- vapply(actual_chars_utf, FUN.VALUE = character(1), 
  function(
    Encoding(x) <- "Windows-1252"
    x
  })

  out <- actual_chars_utf
  names(out) <- mangled_chars_utf
  out
}

text_file <- tempfile()
curl::curl_download("https://dl.dropboxusercontent.com/s/7syikmmiduubsqv/test.txt", text_file)
test_text <- readr::read_lines(text_file)

utf_fix <- create_utf_crosswalk()

stringr::str_replace_all(test_text, utf_fix)
#> [1] "{Província}"

更新

想出了一个直接的解决方案,它适用于示例文本,但不适用于完整文件(也许我没有指定完全正确的文件编码)。

text <- readLines("https://dl.dropboxusercontent.com/s/7syikmmiduubsqv/test.txt")

fixed <- iconv(text, from = "UTF-8", to = "Windows-1252")
Encoding(fixed) <- "UTF-8"

fixed

本文收集自互联网,转载请注明来源。

如有侵权,请联系[email protected] 删除。

编辑于
0

我来说两句

0条评论
登录后参与评论

相关文章

来自分类Dev

将数据保存为CSV并编码为utf-8

来自分类Dev

Powershell Excel-使用编码将文件保存为Unicode UTF-8

来自分类Dev

我认为Ruby UTF-16编码

来自分类Dev

在R中将字符向量编码从“未知”编码为“ UTF-8”

来自分类Dev

R Corpus正在弄乱我的UTF-8编码文本

来自分类Dev

R的UTF-8编码问题

来自分类Dev

如何让R维护utf8编码?

来自分类Dev

R中丢失Č,č字符和UTF编码

来自分类Dev

utf-8中字符的编码问题

来自分类Dev

utf-8编码和希腊字符

来自分类Dev

UTF-8编码仍然错误的输出

来自分类Dev

在 ruby utf-8 错误中编码

来自分类Dev

用非重音对应字符替换R中的重音字符(UTF-8编码)

来自分类Dev

R字符串,UTF-8编码瑞典字符处理

来自分类Dev

可能编码错误,格式错误的 UTF-8 字符

来自分类Dev

R 错误:1:输入的 UTF-8 不正确,请指出编码!XML到列表

来自分类Dev

无法编码的字符,用于编码ASCII,但是我的文件使用UTF-8

来自分类Dev

Openfire:离线UTF-8编码的邮件保存错误

来自分类Dev

Excel使用UTF8编码与UTF8-Bom编码保存CSV文件的行为

来自分类Dev

UTF8字符编码错误

来自分类Dev

R中的表情符号[UTF-8编码]

来自分类Dev

utf8编码让我感到困惑

来自分类Dev

使用错误的文件编码(非 UTF-8)上传 CKEditor 文件

来自分类Dev

当我使用 latin-1 编码将 utf8 编码字符从 Pandas 发送到 mysql 时出现错误的编码字符

来自分类Dev

无法在Python中将UTF8保存为CSV

来自分类Dev

编写平假名时,Python编码错误“ Non-ASCII字符'\ xff'...”尽管编码被声明为“#-*-编码:utf-8-*-”

来自分类Dev

保存文件时Interop.Excel UTF-8编码

来自分类Dev

使用UTF-8编码保存XML文件

来自分类Dev

UTF-8编码问题

Related 相关文章

热门标签

归档