Welcome

首页 / 软件开发 / .NET编程技术 / NPOI实践 - .NET导入Excel文件的另一种选择

NPOI实践 - .NET导入Excel文件的另一种选择2010-11-22tonyqusNPOI之所以强大,并不是因为它支持导出Excel,而是因为它支持导入Excel ,并能“理解”OLE2文档结构,这也是其他一些Excel读写库比较弱的方面。通 常,读入并理解结构远比导出来得复杂,因为导入你必须假设一切情况都是可能 的,而生成你只要保证满足你自己需求就可以了,如果把导入需求和生成需求比 做两个集合,那么生成需求通常都是导入需求的子集,这一规律不仅体现在 Excel读写库中,也体现在pdf读写库中,目前市面上大部分的 pdf库仅支持生成 ,不支持导入。

如果你不相信NPOI能够很好的理解OLE2文档格式,那就去下载POIFS Brower 。具体可以参考这篇文章的介绍:Office文件格式解惑。当然单单理解OLE2是不 够的,因为Excel文件格式是BIFF,但BIFF是以OLE2为基础的,做个很形象的比 喻就是:OLE2相当于磁盘的FAT格式,BIFF相当于文件和文件夹。NPOI负责理解 BIFF格式的代码基本都在HSSF命名空间里面。

好了,刚才废话了一会儿,主要是给大家打打基础,现在进入正题。

本文将以DataTable为容器读入某xls的第一个工作表的数据(最近群里面很 多人问这个问题)。

在开始之前,我们先来补些基础知识。每一个xls都对应一个唯一的 HSSFWorkbook,每一个HSSFWorkbook会有若干个 HSSFSheet,而每一个 HSSFSheet包含若干HSSFRow(Excel 2003中不得超过65535行),每一个HSSFRow 又包含若干个HSSFCell(Excel 2003中不得超过256列)。

为了遍历所有的单元格,我们就得获得某一个HSSFSheet的所有HSSFRow,通 常可以用 HSSFSheet.GetRowEnumerator()。如果要获得某一特定行,可以直接 用HSSFSheet.GetRow(rowIndex)。另外要遍历我们就必须知道边界,有一些属性 我们是可以用的,比如HSSFSheet.FirstRowNum(工作表中第一个有数据行的行 号)、 HSSFSheet.LastRowNum(工作表中最后一个有数据行的行号)、 HSSFRow.FirstCellNum(一行中第一个有数据列的列号)、 HSSFRow.LastCellNum(一行中最后一个有数据列的列号)。

基础知识基本上补得差不多了,现在开工!

首先我们要准备一个用于打开文件流的函数InitializeWorkbook,由于文件 读完后就没用了,所以这里直接用using(养成好习惯,呵呵)。

HSSFWorkbook hssfworkbook;
void InitializeWorkbook(string path)
{
//read the template via FileStream, it is suggested to use FileAccess.Read to prevent file lock.
//book1.xls is an Excel-2007-generated file, so some new unknown BIFF records are added.
using (FileStream file = new FileStream(path, FileMode.Open, FileAccess.Read))
{
hssfworkbook = new HSSFWorkbook(file);
}
}

接下来我们要开始写最重要的函数ConvertToDataTable,即把HSSF的数据放 到一个DataTable中。

HSSFSheet sheet = hssfworkbook.GetSheetAt(0);
System.Collections.IEnumerator rows = sheet.GetRowEnumerator ();
while (rows.MoveNext())
{
HSSFRow row = (HSSFRow)rows.Current;
//TODO::Create DataTable row

for (int i = 0; i < row.LastCellNum; i++)
{
HSSFCell cell = row.GetCell(i);
//TODO::set cell value to the cell of DataTables
}