- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我的任务是读取一些文件数据,对其进行处理,然后将此数据保存到数据库中。
最近,我们开始注意到系统中出现“奇怪”的字符。看起来这是 Unicode 字符的经典案例,我们(开发人员)未能预见到,但当然应该预见到。
我们不确定处理这些数据所需的正确方法,以便最终将其正确地存入数据库。
这是高级流程:
FTP
到达在文件中。 ( xml
文件,顺便说一句。例如 hi.xml
、 foo.xml
等)Azure queue
.Sql Server
.我们无法控制输入源 - 由第三方处理。
那么 - 在 .NET 环境中,我们需要确保我们正在处理的主要信息是什么。就像..伪代码的东西..
encoding="UTF-8/16/<anything>"
在其 xml header /第 1 行中定义。NVARCHAR
(对比 VARCHAR
)我正在研究我们需要满足的要点(相对于.NET),以便我们可以读取->传递->最终从文件->队列->数据库中写入一些Unicode数据,而不会丢失或修改任何数据的这个。
旁白:如果我们收到不良数据,当然,我们无能为力。例如上游数据源在将其数据通过 FTP 发送给我们之前错误地将序列化为文件。
假设:上面的示例文件显示了一些奇怪的字符。该文件在 Visual Studio 中查看。假设这些字符是 Unicode,这就是 VS 显示它们的方式。与...这不是 Unicode,而是错误地保存了源 Unicode 的文件。
引用文献(作为我事先尝试阅读一些内容的证据):
最佳答案
解决方案是正确选择编码
。编码是二进制数据转换为字符串时使用的格式。当数据离开一个特定环境并进入下一个特定环境时,您必须特别注意。您必须确保在每次转换中都不会丢失数据(例如,如果链中存在 ASCII 格式,您将丢失一些信息)。丢失的信息无法恢复。
您必须处理以下转换,并且必须单独处理:
我假设您已经控制了转换 2. 和 3.(如果一切都是 .NET,那么这里根本没有问题)。关键问题是 1. 和 4.(但我也会处理 2.,因为你问题的第三部分提到了它)。
将 XML 读入 .NET
根据 XML 标准,XML 文件的编码可以在 XML 声明中声明,由字节顺序标记确定,也可以从外部源(例如 HTTP header )获知。在 the relevant document 的第 4.3.3 章中它说:
In the absence of information provided by an external transport protocol (e.g. HTTP or MIME), it is an error for an entity including an encoding declaration to be presented to the XML processor in an encoding other than that named in the declaration, or for an entity which begins with neither a Byte Order Mark nor an encoding declaration to use an encoding other than UTF-8.
这意味着,如果您收到的文档没有 XML 声明(标准允许)或 BOM,则必须假定它们是 UTF-8。当然,在实践中,并不总是遵循标准,因此您收到的数据格式是否正确取决于您的源与标准的严格程度(指您的第一个问题)。如果可以的话,你应该澄清这一点。根据拒绝无效数据的灵 active ,您还可以决定遵循 XML 标准(这就是标准的用途),并让源负责确保数据正确。
如果您直接使用 System.Xml
和/或 System.Xml.Linq
命名空间中的 .NET 类,尤其是直接使用 XmlReader
在二进制源上(不将其转换为字符串),会自动评估 XML 声明和 BOM,并以正确的格式读取 XML。直接从流创建 XML 读取器很简单:
Stream inputStream;
// Create a stream from your data, depending on the source (e.g. FileStream)
XmlReader reader = XmlReader.Create(inputStream);
// Use the reader
这种方式提供了完整的 unicode 支持(这应该可以回答您的第一个问题)。
将数据保存到队列
如果您对创建 JSON 的解决方案感到满意,则不应更改它。用于存储数据的编码与您使用的高级格式(纯文本、JSON、XML 等)无关。只要您使用 .NET,字符串就会以 Unicode 存储,并且您不会丢失任何数据。但是,如果您在流程链中有任何序列化/反序列化,请确保使用不涉及数据丢失的匹配编码进行序列化和反序列化(可以是 UTF-8 或 Unicode,无论您的场景中哪种更有效)。
将数据保存到数据库
根据您的源数据,您可以选择可以存储您可能遇到的任何字符的排序规则(当然您需要首先知道这一点)并使用 VARCHAR
或者您可以使用 NVARCHAR
,它将能够存储任何可能的 Unicode 文本。前者使用较少的存储空间,但如果在输入数据中发现一些意外字符,可能会导致一些数据丢失。后者可以存储任何东西,但需要双倍的空间。
关于c# - 如何在.NET 中读取包含 Unicode 的 xml 文本文件,然后将其保存到数据库中?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/46046874/
我尝试根据表单元素的更改禁用/启用保存按钮。但是,当通过弹出按钮选择更改隐藏输入字段值时,保存按钮不受影响。 下面是我的代码。我正在尝试序列化旧的表单值并与更改后的表单值进行比较。但我猜隐藏的字段值无
我正在尝试保存模型的实例,但我得到了 Invalid EmbeddedDocumentField item (1) 其中 1 是项目的 ID(我认为)。 模型定义为 class Graph(Docum
我有一个非常奇怪的问题......在我的 iPhone 应用程序中,用户可以打开相机胶卷中的图像,在我的示例中 1920 x 1080 像素 (72 dpi) 的壁纸。 现在,想要将图像的宽度调整为例
目前,我正在使用具有排序/过滤功能的数据表成功地从我的数据库中显示图像元数据。在我的数据表下方,我使用第三方图像覆盖流( http://www.jacksasylum.eu/ContentFlow/
我的脚本有问题。我想按此顺序执行以下步骤: 1. 保存输入字段中的文本。 2. 删除输入字段中的所有文本。 3. 在输入字段中重新加载之前删除的相同文本。 我的脚本的问题是 ug()- 函数在我的文本
任何人都可以帮助我如何保存多对多关系吗?我有任务,用户可以有很多任务,任务可以有很多用户(多对多),我想要实现的是,在更新表单中,管理员可以将多个用户分配给特定任务。这是通过 html 多选输入来完成
我在 Tensorflow 中训练了一个具有批归一化的模型。我想保存模型并恢复它以供进一步使用。批量归一化是通过 完成的 def batch_norm(input, phase): retur
我遇到了 grails 的问题。我有一个看起来像这样的域: class Book { static belongsTo = Author String toString() { tit
所以我正在开发一个应用程序,一旦用户连接(通过 soundcloud),就会出现以下对象: {userid: userid, username: username, genre: genre, fol
我正在开发一个具有多选项卡布局的 Angular 7 应用程序。每个选项卡都包含一个组件,该组件可以引用其他嵌套组件。 当用户选择一个新的/另一个选项卡时,当前选项卡上显示的组件将被销毁(我不仅仅是隐
我尝试使用 JEditorPane 进行一些简单的文本格式化,但随着知识的增长,我发现 JTextPane 更容易实现并且更强大。 我的问题是如何将 JTextPane 中的格式化文本保存到文件?它应
使用 Docker 相当新。 我为 Oracle 11g Full 提取了一个图像。创建了一个数据库并将应用程序安装到容器中。 正确配置后,我提交了生成 15GB 镜像的容器。 测试了该图像的新容器,
我是使用 Xcode 和 swift 的新手,仍在学习中。我在将核心数据从实体传递到文本字段/标签时遇到问题,然后用户可以选择编辑和保存记录。我的目标是,当用户从 friendslistViewCon
我正在用 Java 编写 Android 游戏,我需要一种可靠的方法来快速保存和加载应用程序状态。这个问题似乎适用于大多数 OO 语言。 了解我需要保存的内容:我正在使用策略模式来控制我的游戏实体。我
我想知道使用 fstream 加载/保存某种结构类型的数组是否是个好主意。注意,我说的是加载/保存到二进制文件。我应该加载/保存独立变量,例如 int、float、boolean 而不是结构吗?我这么
我希望能够将 QNetworkReply 保存到 QString/QByteArray。在我看到的示例中,它们总是将流保存到另一个文件。 目前我的代码看起来像这样,我从主机那里得到一个字符串,我想做的
我正在创建一个绘图应用程序。我有一个带有 Canvas 的自定义 View ,它根据用户输入绘制线条: class Line { float startX, startY, stopX, stop
我有 3 个 Activity 第一个 Activity 调用第二个 Activity ,第二个 Activity 调用第三个 Activity 。 第二个 Activity 使用第一个 Activi
我想知道如何在 Xcode 中保存 cookie。我想使用从一个网页获取的 cookie 并使用它访问另一个网页。我使用下面的代码登录该网站,我想保存从该连接获得的 cookie,以便在我建立另一个连
我有一个 SQLite 数据库存储我的所有日历事件,建模如下: TimerEvent *Attributes -date -dateForMark -reminder *Relat
我是一名优秀的程序员,十分优秀!