c# - 使用itextsharp xmlworker将html转pdf并竖写文字

转载作者：太空狗更新时间：2023-10-29 13:13:47

24

4

在xmlworker中是否可以实现自下而上的书写方向？我想在表中使用它。我的代码是

     <table border=1>
     <tr>
     <td style="padding-right:18px">
          <p style="writing-mode:sideways-lr;text-align:center">First</p</td>
     <td style="padding-right:18px">
          <p style="writing-mode:sideways-lr;text-align:center">Second</p></td></tr>
     <tr><td><p style="text-align:center">1</p>  </td>
         <td><p style="text-align:center">2</p></td> 
     </tr>
        </table>

但是从 html 转换为 pdf 后它不起作用。文本 FIRST 和 SECOND 不是自下而上的方向。

最佳答案

这是一个非常有趣的问题，因此对该问题 +1。

第一步是查找 iTextSharp XML Worker 是否支持 HTML td 标签。这些映射可以在 iTextSharp.tool.xml.html.Tags 的源代码中找到。 .你会发现 td 被映射到 iTextSharp.tool.xml.html.table.TableData ，这使得实现自定义标签处理器的工作变得更容易一些。 IE。我们需要做的就是从类继承并覆盖 End():

public class TableDataProcessor : TableData
{
    /*
     * a **very** simple implementation of the CSS writing-mode property:
     * https://developer.mozilla.org/en-US/docs/Web/CSS/writing-mode
     */
    bool HasWritingMode(IDictionary<string, string> attributeMap)
    {
        bool hasStyle = attributeMap.ContainsKey("style");
        return hasStyle
                && attributeMap["style"].Split(new char[] { ';' })
                .Where(x => x.StartsWith("writing-mode:"))
                .Count() > 0
            ? true : false;
    }

    public override IList<IElement> End(
        IWorkerContext ctx,
        Tag tag,
        IList<IElement> currentContent)
    {
        var cells = base.End(ctx, tag, currentContent);
        var attributeMap = tag.Attributes;
        if (HasWritingMode(attributeMap))
        {
            var pdfPCell = (PdfPCell) cells[0];
            // **always** 'sideways-lr'
            pdfPCell.Rotation = 90;
        }
        return cells;
    }
}

如内嵌评论中所述，这是一个非常简单的实现，可满足您的特定需求。您需要添加额外的逻辑来支持任何其他 writing-mode CSS property value ，并包括任何完整性检查。

更新

根据 @Daniel 留下的评论，不清楚如何在将 HTML 转换为 PDF 时添加自定义 CSS。首先是更新后的 HTML:

string XHTML = @"
<h1>Table with Vertical Text</h1>
<table><tr>
<td style='writing-mode:sideways-lr;text-align:center;width:40px;'>First</td>
<td style='writing-mode:sideways-lr;text-align:center;width:40px;'>Second</td></tr>
<tr><td style='text-align:center'>1</td>
<td style='text-align:center'>2</td></tr></table>

<h1>Table <u>without</u> Vertical Text</h1>
<table width='50%'>
<tr><td class='light-yellow'>0</td></tr>
<tr><td>1</td></tr>
<tr><td class='light-yellow'>2</td></tr>
<tr><td>3</td></tr>
</table>";

然后是一小段自定义 CSS:

string CSS = @"
    body {font-size: 12px;}
    table {border-collapse:collapse; margin:8px;}
    .light-yellow {background-color:#ffff99;}
    td {border:1px solid #ccc;padding:4px;}
";

稍微困难的部分是额外的设置 - 您不能使用 SO 常见的开箱即用的简单 XMLWorkerHelper.GetInstance().ParseXHtml()。这是一个简单的辅助方法，可以帮助您入门:

public void ConvertHtmlToPdf(string xHtml, string css)
{
    using (var stream = new FileStream(OUTPUT_FILE, FileMode.Create))
    {
        using (var document = new Document())
        {
            var writer = PdfWriter.GetInstance(document, stream);
            document.Open();

            // instantiate custom tag processor and add to `HtmlPipelineContext`.
            var tagProcessorFactory = Tags.GetHtmlTagProcessorFactory();
            tagProcessorFactory.AddProcessor(
                new TableDataProcessor(), 
                new string[] { HTML.Tag.TD }
            );
            var htmlPipelineContext = new HtmlPipelineContext(null);
            htmlPipelineContext.SetTagFactory(tagProcessorFactory);

            var pdfWriterPipeline = new PdfWriterPipeline(document, writer);
            var htmlPipeline = new HtmlPipeline(htmlPipelineContext, pdfWriterPipeline);

            // get an ICssResolver and add the custom CSS
            var cssResolver = XMLWorkerHelper.GetInstance().GetDefaultCssResolver(true);
            cssResolver.AddCss(css, "utf-8", true);
            var cssResolverPipeline = new CssResolverPipeline(
                cssResolver, htmlPipeline
            );

            var worker = new XMLWorker(cssResolverPipeline, true);
            var parser = new XMLParser(worker);
            using (var stringReader = new StringReader(xHtml))
            {
                parser.Parse(stringReader);
            }
        }
    }
}

see the documentation 不是重复对上面示例代码的解释(iText 删除了文档，链接到 Wayback Machine)以更好地了解为什么需要以这种方式设置解析器。

另请注意:

XML Worker 不支持所有 CSS2/CSS3 属性，因此您可能需要试验哪些有效或无效，以确定您希望PDF 查看浏览器中显示的 HTML。
HTML 片段删除了 p 标签，因为样式可以直接应用于 td 标签。
内联 width 属性。如果省略，列的宽度将与水平呈现的文本相匹配。

使用 iTextSharp 和 XML Worker 版本 5.5.9 进行测试这是更新的结果:

关于c# - 使用itextsharp xmlworker将html转pdf并竖写文字，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/36180131/

24

4

0

文章推荐： python - 如何在 Jupyter 上以 HTML 格式导出当前笔记本

文章推荐： bash - 为什么我需要 Root 权限才能执行 `git branch -a` ？

文章推荐： android - 如何在框架布局上模糊新添加 View 的背景？Android

文章推荐： git - Sourcetree 未检测到对 .dll 文件的更改

pdf - 将多个 PDF 合并为一个 PDF
我的代码有一些问题。我正在尝试遍历包含许多 PDF 的 Drive 文件夹，然后将它们合并为一个文件。当我使用我的代码时，它只是为 Drive 文件夹中的最后一个 PDF 创建一个 PDF，而不是按预
pdf - PDF 规范中的最小 PDF 示例
我从 PDF Specification 获取了 PDF 规范中的最小 PDF 示例。，将其复制到记事本，将文件重命名为扩展名为 .pdf。我可以用其他 PDF 查看器(PDF-XChange、S
pdf - 在不破坏可访问性或 PDF 标签的情况下连接 PDF
感谢您在以下方面的帮助: 我有 2 个部分可访问的 PDF(包含标签)，我想使用一些命令行工具(如 PDFtk 或 Ghostscript，或任何 Perl 模块)将它们连接起来: 我已经尝试使用 P
pdf - Ghostscript - 将矢量 pdf 转换为光栅 pdf
我想使用 ghostscript 将矢量 pdf 转换为光栅 pdf(即光栅化矢量 pdf)。但是即使我添加了解析参数 -r300，我也找不到合适的参数来执行此操作。我使用的代码是-dSAFER -
pdf - iTextSharp 可以将 PDF 文档转换为 PDF/A
我无法在 FAQ 中找到这个功能是否存在于 API 中，尽管它在书中提到作为潜在可用的东西。有没有人有任何实现此功能的经验？最佳答案在 This thread (日期为 2007 年 6 月)Pa
pdf - 使用 pdf.js 在网站上显示 PDF
我要放文件sample.pdf在我的网站上，并希望使用 pdf.js 显示它.我想要的是显示我自己的文件，如 demo ，带有工具栏，放大/缩小等。到目前为止，我还不能这样做。我确实检查了 hell
pdf - 将 PDF 转换为 PDF/A-1
我知道这可能不是严格意义上的编程问题(也许是，我不知道)但我在尝试转换常规 pdf(带有超链接、书签、图像、嵌入字体等)时遇到了严重问题.) 转换为 PDF/A-1 格式。当我用 pdfaPilot
PDF.js 能够创建 pdf 文件或 PDF.js 只是一个让 PDF 文件显示在网络浏览器上的功能？
这是 PDF.js 网站 https://github.com/mozilla/pdf.js 我正在搜索和阅读很多文章，大多数编码都是将 pdf 导入 pdf.js 并在浏览器上显示，我不明白是不是
pdf-generation - 扫描图像/PDF 到可搜索图像/PDF
谁能建议我如何将扫描图像转换为可搜索图像或如何将扫描 pdf 转换为可搜索 pdf？很长一段时间以来，我一直陷入这种情况。我已经在 ubuntu 中尝试过 pdfocr 应用程序，但没有成功。最
pdf - Itext pdf 延迟签名导致 pdf 签名无效
作为我对客户端/服务器 pdf 签名研究的一部分，我测试了 itext pdf 延迟签名示例。不幸的是，我生成的 pdf 即合并空签名 pdf 和哈希值的输出显示无效签名。我的代码片段如下 cla
pdf - 在 PDF 中插入 PDF(不合并文件)
我想将一个 PDF 页面插入到另一个已缩放的 PDF 页面中。我想使用 iTextSharp 来实现此目的。我有一个矢量绘图，可以导出为单页 PDF 文件。我想将此文件添加到其他 PDF 文档的页面
pdf - Itext pdf 延迟签名导致 pdf 签名无效
作为我对客户端/服务器 pdf 签名研究的一部分，我测试了 itext pdf 延迟签名示例。不幸的是，我生成的 pdf 即合并空签名 pdf 和哈希值的输出显示无效签名。我的代码片段如下 cla
pdf - 裁剪基于文本的多页 PDF 文档的白边并将其转换为基于图像的 PDF 文档
我想为 Kindle 转换电子书。我尝试使用 Calibre 将具有复杂格式样式和图像的基于两种语言的基于文本的大型 PDF 电子书转换为适用于 Kindle 的 AZW3 电子书，并且还尝试了亚马逊
pdf - 如何仅使用 Adobe PDF 插件强制在谷歌浏览器中显示 PDF
我在 Google Chrome 中显示 pdf 时遇到问题。问题是 Chrome 将 pdf 的某些页面显示为黑色。启用 Chrome PDF 查看器时会发生这种情况。如果我禁用此插件并使用 Ad
pdf - 打印时将空白页插入 PDF
我确信这个问题无处不在，尽管我似乎找不到答案。我希望我的 PDF 文档在 PDF 阅读器中显示时没有空白页，但随后在封面后打印空白页，这样打印出来的文档在右侧甚至左侧都有奇数页。还有其他人遇到过这个问
pdf - 从命令行自动裁剪 pdf
我需要自动裁剪 pdf 文件(去除白边)。到目前为止，我尝试了两种并不完美的工具: pdf裁剪问题:它不会裁剪某些 pdf。 pdf-crop-margins 问题:有时它裁剪得太多(精细的细节)。
pdf - PDF 中的透明图像
This PDF由几个源文件组成。其中五个是包含 alpha channel 的 PNG。一种是没有 alpha channel 的 PNG。最后一 block 是带有透明效果的 Photoshop
pdf - 将内部维基页面转换为 PDF
我的团队将内部 wiki 页面用于各种内容。这些页面是使用 MediaWiki 创建的。我想知道是否有任何方法可以将 wiki 页面转换为 PDF 格式。我必须用它来将用户文档转换为 PDF 格式，以
pdf - 从结构化数据生成 PDF
我希望能够从我可能在数据库或 xml 或任何其他结构化形式中拥有的数据生成高度图形化(也包含大量文本内容)的 PDF 文件。目前，我们的平面设计师在将内容作为 MS Word 文档后，在 Photo
pdf - 查找重复的 PDF
我正在寻找可以帮助我找到重复 PDF 的实用程序。问题:我有 1000 个 PDF 文件。有些是重复的。由于不同的文件名和文件大小的微小差异，它们不容易被检测到。是否有实用程序/算法/库可以帮助我找到

首页

博学

6Ren·AI

商城

c# - 使用itextsharp xmlworker将html转pdf并竖写文字

更新