麦克劳 发表于 2024-11-1 19:00:22

C# 将PDF文档转换为Markdown文档

将PDF文件转换为Markdown格式是一个非常实用的需求,尤其是在需要将内容从固定布局的PDF文件中提取出来,并转换为更易于编辑和处理的文本格式时。本文将介绍如何通过C#代码将PDF文档转换Markdown(MD)文档。
 
需要用到第三方库 Spire.PDF for .NET。可以从以下链接下载产品包后手动添加引用,或者直接通过NuGet安装。
https://www.e-iceblue.cn/Downloads/Spire-PDF-NET.html
 
C# 将PDF转为Markdown文档

步骤:

[*]创建 PdfDocument 类的对象
[*]通过 LoadFromFile() 方法加载PDF文档;
[*]通过 SaveToFile(string filename, FileFormat.Markdown) 将加载的PDF文档转换为markdown文档。
示例代码:
using Spire.Pdf;

namespace PDFToMarkdown
{
    class Program
    {
      static void Main(string[] args)
      {
            //加载PDF文档
            PdfDocument pdf = new PdfDocument();
            pdf.LoadFromFile("测试.pdf");

            //将PDF转换为MD文档
            pdf.SaveToFile("PDF转Markdown.md", FileFormat.Markdown);
            pdf.Close();
      }
    }
}
 
该Spire.PDF for .NET库支持多种在.NET 程序创建、读取、转换、打印PDF文档的操作,更多示例可以参考:
https://www.e-iceblue.cn/spirepdfnet/spire-pdf-for-net-program-guide-content.html
 
对于生成文档中的水印,点击申请临时授权移除并完整试用:
https://www.e-iceblue.cn/misc/temporary-license.html



来源:https://www.cnblogs.com/Yesi/p/18520083
免责声明:由于采集信息均来自互联网,如果侵犯了您的权益,请联系我们【E-Mail:cb@itdo.tech】 我们会及时删除侵权内容,谢谢合作!
页: [1]
查看完整版本: C# 将PDF文档转换为Markdown文档