C#提取PDF表单数据的实现流程

2025-01-29 04:50

本文主要是介绍C#提取PDF表单数据的实现流程,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

《C#提取PDF表单数据的实现流程》PDF表单是一种常见的数据收集工具,广泛应用于调查问卷、业务合同等场景,凭借出色的跨平台兼容性和标准化特点,PDF表单在各行各业中得到了广泛应用,本文将探讨如何使用...

引言

PDF表单是一种常见的数据收集工具,广泛应用于调查问卷、业务合同等场景。凭借出色的跨平台兼容性和标准化特点,PDF表单在各行各业中得到了广泛应用。然而,当需要整合、分析或导入大量已填写的表单数据时,传统的手动处理方式不仅耗时,而且容易出错。因此,掌握自动提取PDF表http://www.chinasem.cn单数据的方法,不仅能大幅提高工作效率,还能确保数据处理的准确性。本文将探讨如何使用C# 实现自动化PDF表单数据提取流程。

  • 使用工具
  • C# 提取多个PDF表单域的数据
  • C# 提取特定PDF表单域的数据

使用工具

要使用C# 提取PDF表单的数据,需要用到合适的PDF文档处理库。本文所使用的是Spire.PDF for .NET库。该库主要用于在 .NET 应用程序中创建、读取、编辑、转换 和打印PDF 文档。

安装 Spire.PDF for .NET

你可以在 NuGet 包管理器中运行以下命令安装 Spire.PDF for .NET:

PM> Install-Package Spire.PDF

如果你已经安装了该库并希望升级到最新版本,可以使用以下命令:

PM> Update-Package Spire.PDF

C# 提取多个PDF表单域的数据

PDF 表单可能包含多种类型的域,例如文本框、列表框、下拉框、单选按钮和复选框。每种域类型需要采用不同的方法来提取其数据。以下是提取这些类型的域的数据时所使用的关键属性:

  • 文本框(Text Boxes
    通过 PdfTextBoxFieldwidget 对象的 Name 和 Text 属性,获取文本框的名称及其对应的值。
  • 列表框(List Boxes
    通过 PdfListBoxFieldWidget 对象的 Name、Values 和 SelectedValue 属性,提取列表框的名称、所有选项及选定的选项。
  • 下拉框(Combo Boxes
    通过 PdfComboBoxFieldWidget 对象的 Name、Values 和 SelectedValue 属性,获取下拉框的名称、所有选项及选定的选项。
  • 单选按钮(Radio Buttons
    通过 PdfRadioButtonListFieldWidget 对象的 Name 和 SelectedValue 属性,获取单选按钮的名称和选定的值。
  • 复选框(Checkboxes
    通过 PdfCheckBoxFieldWidget 对象的 Name 和 Checked 属性,提取复选框的名称及其状态(是否被选中)。

以下代码展示了如何使用 C# 从多个 PDF 表单域中提取数据:

using Spire.Pdf;
using Spire.Pdf.Fields;
using Spire.Pdf.Widget;
using System.Collections.Generic;
using System.IO;
 
namespace ExtractPdfFormData
{
    internal class Program
    {
        static void Main(string[] args)
        {
            // 初始化 PdfDocument 类实例,用于加载和处理 PDF 文件
            using (PdfDocument doc = new PdfDocument())
            {
                // 加载包含表单域的 PDF 文件
                doc.LoadFromFile("表单.pdf");
 
                // 创建列表存储提取的域名称及其值
                List<string> content = new List<string>();
 
                // 获取 PDF 文档的表单对象
                PdfFormWidget formWidget = doc.Form as PdfFormWidget;
 
                // 检查表单对象中是否包含表单域
                if (formWidget?.FieldsWidget.Count > 0)
                {
                    // 遍历文档中的所有表单域
                    for (int i = 0; i < formWidget.FieldsWidget.List.Count; i++)
                    {
                        // 获取当前表单域
                        PdfField field = formWidget.FieldsWidget[i];
 
                        // 如果当前表单域为空,跳过该域
                        if (field == null) continue;
 
                        // 提取当前表单域的内容(名称和值)
                        List<string> currentFieldContent = ExtractFieldContent(fwww.chinasem.cnield);
 
                        // 如果提取到域内容,则将其添加到 content 列表中
                        if (currentFieldContent.Count > 0)
        http://www.chinasem.cn                {
                            content.AddRange(currentFieldContent);
 
                            // 如果不是最后一个表单域,添加一个空行用于分隔不同域的内容
                            if (i < formWidget.FieldsWidget.List.Count - 1)
                            {
                                content.Add(""); // 添加空行分隔不同域的内容
                            }
                        }
                    }
                }
 
                // 将提取的内容逐行写入文本文件
                File.WriteAllLines("提取域数据.txt", content);
            }
        }
 
        /// <summary>
        /// 提取单个 PDF 表单域的内容(域名和域值)
        /// 根据不同的表单域类型(文本框、列表框、下拉框、单选按钮、复选框)提取相应的值
        /// </summary>
        /// <param name="field">当前的 PDF 表单域对象</param>
        /// <returns>包含域内容的字符串列表</returns>
        private static List<string> ExtractFieldContent(PdfField field)
        {
            // 初始化列表来存储当前表单域的内容
            List<string> fieldContent = new List<string>();
 
            // 检查该域是否为文本框
            if (field is PdfTextBoxFieldWidget textBoxField)
            {
                fieldContent.Add($"文本框名称:{textBoxField.Name}");
                fieldContent.Add($"文本框值:{textBoxFielChina编程d.Text}");
            }
            // 检查该域是否为列表框
            else if (field is PdfListBoxWidgetFieldWidget listBoxField)
            {
                fieldContent.Add($"列表框名称:{listBoxField.Name}");
                fieldContent.Add("列表框选项:");
                // 遍历并提取列表框中的所有选项
                foreach (PdfListWidgetItem item in listBoxField.Values)
                {
                    fieldContent.Add($"{item.Value}");
                }
                fieldContent.Add($"列表框选中项:{listBoxField.SelectedValue}");
            }
            // 检查该域是否为下拉框
            else if (field is PdfComboBoxWidgetFieldWidget comboBoxField)
            {
                fieldContent.Add($"下拉框名称:{comboBoxField.Name}");
                fieldContent.Add("下拉框选项:");
                // 遍历并提取下拉框中的所有选项
                foreach (PdfListWidgetItem item in comboBoxField.Values)
                {
                    fieldContent.Add($"{item.Value}");
                }
                fieldContent.Add($"下拉框选中项:{comboBoxField.SelectedValue}");
            }
            // 检查该域是否为单选按钮
            else if (field is PdfRadioButtonListFieldWidget radioBtnField)
            {
                fieldContent.Add($"单选按钮名称:{radioBtnField.Name}");
                fieldContent.Add($"单选按钮选中项:{radioBtnField.SelectedValue}");
            }
            // 检查该域是否为复选框
            else if (field is PdfCheckBoxWidgetFieldWidget checkBoxField)
            {
                fieldContent.Add($"复选框名称:{checkBoxField.Name}");
                fieldContent.Add($"复选框状态:{(checkBoxField.Checked ? "选中" : "未选中")}");
            }
 
            // 返回当前表单域的内容
            return fieldContent;
        }
    }
}

C# 提取特定PDF表单域的数据

如果你需要从特定的表单域中提取数据,可以通过该表单域的名称直接访问它,然后通过判断其类型对应地获取其内容。

以下代码展示了如何使用C# 从名为 “国家” 的PDF表单域中提取数据:

using Spire.Pdf;
using Spire.Pdf.Fields;
using Spire.Pdf.Widget;
using System.Collections.Generic;
using System.IO;
 
namespace ExtractSpecificFormData
{
    internal class Program
    {
        static void Main(string[] args)
        {
            // 初始化 PdfDocument 类实例,用于加载和处理 PDF 文件
            using (PdfDocument doc = new PdfDocument())
            {
                // 加载包含表单域的 PDF 文件
                doc.LoadFromFile("表单.pdf");
 
                // 创建列表来存储提取的表单域名称及其值
                List<string> content = new List<string>();
 
                // 获取 PDF 文档的表单对象
                PdfFormWidget formWidget = doc.Form as PdfFormWidget;
 
                // 指定域名称
                string fieldName = "国家";
 
                // 检查表单对象中是否包含表单域
                if (formWidget?.FieldsWidget.Count > 0)
                {
                    // 通过名称访问特定表单域
                    PdfField specificField = formWidget.FieldsWidget[fieldName];
 
                    // 确保域存在再进行处理
                    if (specificField != null)
                    {
                        // 提取特定表单域的内容(名称和值)
                        List<string> specificFieldContent = ExtractFieldContent(specificField);
 
                        // 如果提取到内容,则将其添加到 content 列表中
                        if (specificFieldContent.Count > 0)
                        {
                            content.AddRange(specificFieldContent);
                        }
                    }
                    else
                    {
                        content.Add($"未找到域 '{fieldName}'");
                    }
                }
                else
                {
                    content.Add("PDF 表单中未找到任何域");
                }
 
                // 将提取的内容逐行写入文本文件
                File.WriteAllLines("提取特定域数据.txt", content);
            }
        }
 
        /// <summary>
        /// 提取单个 PDF 表单域的内容(名称和值)
        /// 处理不同类型的表单域,如文本框、列表框、下拉框、单选按钮和复选框
        /// </summary>
        /// <param name="field">当前 PDF 表单域对象</param>
        /// <returns>包含表单域内容的字符串列表</returns>
        private static List<string> ExtractFieldContent(PdfField field)
        {
            // 初始化列表来存储当前表单域的内容
            List<string> fieldContent = new List<string>();
 
            // 检查该域是否为文本框
            if (field is PdfTextBoxFieldWidget textBoxField)
            {
                // 将文本框的名称和值添加到列表中
                fieldContent.Add($"文本框名称:{textBoxField.Name}");
                fieldContent.Add($"文本框值:{textBoxField.Text}");
            }
            // 检查该域是否为列表框
            else if (field is PdfListBoxWidgetFieldWidget listBoxField)
            {
                fieldContent.Add($"列表框名称:{listBoxField.Name}");
                fieldContent.Add("列表框选项:");
                foreach (PdfListWidgetItem item in listBoxField.Values)
                {
                    fieldContent.Add($"{item.Value}");
                }
                fieldContent.Add($"列表框选中项:{listBoxField.SelectedValue}");
            }
            // 检查该域是否为下拉框
            else if (field is PdfCombChina编程oBoxWidgetFieldWidget comboBoxField)
            {
                fieldContent.Add($"下拉框名称:{comboBoxField.Name}");
                fieldContent.Add("下拉框选项:");
                foreach (PdfListWidgetItem item in comboBoxField.Values)
                {
                    fieldContent.Add($"{item.Value}");
                }
                fieldContent.Add($"下拉框选中项:{comboBoxField.SelectedValue}");
            }
            // 检查该域是否为单选按钮
            else if (field is PdfRadioButtonListFieldWidget radioBtnField)
            {
                fieldContent.Add($"单选按钮名称:{radioBtnField.Name}");
                fieldContent.Add($"单选按钮选中项:{radioBtnField.SelectedValue}");
            }
            // 检查该域是否为复选框
            else if (field is PdfCheckBoxWidgetFieldWidget checkBoxField)
            {
                fieldContent.Add($"复选框名称:{checkBoxField.Name}");
                fieldContent.Add($"复选框状态:{(checkBoxField.Checked ? "选中" : "未选中")}");
            }
 
            // 返回当前表单域的内容列表
            return fieldContent;
        }
    }
}

以上就是使用C# 读取PDF表单域数据的全部内容。

到此这篇关于C#提取PDF表单数据的实现流程的文章就介绍到这了,更多相关C#提取PDF表单数据内容请搜索编程China编程(www.chinasem.cn)以前的文章或继续浏览下面的相关文章希望大家以后多多支持China编程(www.chinasem.cn)!

这篇关于C#提取PDF表单数据的实现流程的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1153266

相关文章

C#借助Spire.XLS for .NET实现在Excel中添加文档属性

《C#借助Spire.XLSfor.NET实现在Excel中添加文档属性》在日常的数据处理和项目管理中,Excel文档扮演着举足轻重的角色,本文将深入探讨如何在C#中借助强大的第三方库Spire.... 目录为什么需要程序化添加Excel文档属性使用Spire.XLS for .NET库实现文档属性管理Sp

Python+FFmpeg实现视频自动化处理的完整指南

《Python+FFmpeg实现视频自动化处理的完整指南》本文总结了一套在Python中使用subprocess.run调用FFmpeg进行视频自动化处理的解决方案,涵盖了跨平台硬件加速、中间素材处理... 目录一、 跨平台硬件加速:统一接口设计1. 核心映射逻辑2. python 实现代码二、 中间素材处

Java数组动态扩容的实现示例

《Java数组动态扩容的实现示例》本文主要介绍了Java数组动态扩容的实现示例,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 目录1 问题2 方法3 结语1 问题实现动态的给数组添加元素效果,实现对数组扩容,原始数组使用静态分配

Python实现快速扫描目标主机的开放端口和服务

《Python实现快速扫描目标主机的开放端口和服务》这篇文章主要为大家详细介绍了如何使用Python编写一个功能强大的端口扫描器脚本,实现快速扫描目标主机的开放端口和服务,感兴趣的小伙伴可以了解下... 目录功能介绍场景应用1. 网络安全审计2. 系统管理维护3. 网络故障排查4. 合规性检查报错处理1.

MySQL快速复制一张表的四种核心方法(包括表结构和数据)

《MySQL快速复制一张表的四种核心方法(包括表结构和数据)》本文详细介绍了四种复制MySQL表(结构+数据)的方法,并对每种方法进行了对比分析,适用于不同场景和数据量的复制需求,特别是针对超大表(1... 目录一、mysql 复制表(结构+数据)的 4 种核心方法(面试结构化回答)方法 1:CREATE

Python轻松实现Word到Markdown的转换

《Python轻松实现Word到Markdown的转换》在文档管理、内容发布等场景中,将Word转换为Markdown格式是常见需求,本文将介绍如何使用FreeSpire.DocforPython实现... 目录一、工具简介二、核心转换实现1. 基础单文件转换2. 批量转换Word文件三、工具特性分析优点局

Springboot3统一返回类设计全过程(从问题到实现)

《Springboot3统一返回类设计全过程(从问题到实现)》文章介绍了如何在SpringBoot3中设计一个统一返回类,以实现前后端接口返回格式的一致性,该类包含状态码、描述信息、业务数据和时间戳,... 目录Spring Boot 3 统一返回类设计:从问题到实现一、核心需求:统一返回类要解决什么问题?

详解C++ 存储二进制数据容器的几种方法

《详解C++存储二进制数据容器的几种方法》本文主要介绍了详解C++存储二进制数据容器,包括std::vector、std::array、std::string、std::bitset和std::ve... 目录1.std::vector<uint8_t>(最常用)特点:适用场景:示例:2.std::arra

Java使用Spire.Doc for Java实现Word自动化插入图片

《Java使用Spire.DocforJava实现Word自动化插入图片》在日常工作中,Word文档是不可或缺的工具,而图片作为信息传达的重要载体,其在文档中的插入与布局显得尤为关键,下面我们就来... 目录1. Spire.Doc for Java库介绍与安装2. 使用特定的环绕方式插入图片3. 在指定位

Java使用Spire.Barcode for Java实现条形码生成与识别

《Java使用Spire.BarcodeforJava实现条形码生成与识别》在现代商业和技术领域,条形码无处不在,本教程将引导您深入了解如何在您的Java项目中利用Spire.Barcodefor... 目录1. Spire.Barcode for Java 简介与环境配置2. 使用 Spire.Barco