Java için GroupDocs.Parser ile Excel Nasıl Ayrıştırılır – Kılavuz
Günümüzün veri odaklı uygulamalarında, Excel dosyalarını nasıl ayrıştırılır sorusu verimli bir şekilde iş akışını belirleyebilir ya da bozabilir. İster eski verileri taşıyor olun, otomatik raporlar oluşturuyor olun ya da ham metni analiz boru hatlarına besliyor olun, her çalışma sayfasından biçimlendirilmemiş metni çıkarmak yaygın bir gereksinimdir. Bu öğretici, GroupDocs.Parser for Java kullanarak Excel dosyalarını ayrıştırmayı, Excel sayfa metnini okumayı ve minimum kodla ham içeriği almayı adım adım gösterir.
Hızlı Yanıtlar
- Java’da Excel ayrıştırmasını hangi kütüphane yönetir? GroupDocs.Parser for Java.
- Her sayfadan ham metin çıkarabilir miyim? Evet, ham mod etkinleştirilmiş
TextReaderkullanarak. - Lisans gerekir mi? Değerlendirme için geçici ücretsiz bir lisans mevcuttur.
- Hangi Java sürümü gereklidir? JDK 8 veya üzeri.
- Maven destekleniyor mu? Kesinlikle – depoyu ve bağımlılığı
pom.xmldosyasına ekleyin.
GroupDocs.Parser ile “Excel nasıl ayrıştırılır” nedir?
GroupDocs.Parser ile Excel ayrıştırmak, programlı olarak bir .xlsx (veya diğer desteklenen) çalışma kitabını açmak, sayfalarını döngüyle gezmek ve herhangi bir biçimlendirme olmadan düz metni okumak anlamına gelir. Bu yaklaşım, tüm çalışma kitabını ağır bir elektronik tablo API’sine yüklemekten daha hızlıdır ve temel karakterlere doğrudan erişim sağlar.
Neden Java için GroupDocs.Parser Kullanmalı?
- Hız ve düşük bellek ayak izi: Bir seferde bir sayfa işler.
- Geniş format desteği: XLSX, XLS, CSV ve daha fazlasını işler.
- Basit API: Metin çıkarmaya başlamak için sadece birkaç satır kod.
- Kurumsal‑hazır lisanslama: Ücretsiz deneme, ardından ölçeklenebilir ticari seçenekler.
Önkoşullar
- Java Development Kit (JDK): 8 veya üzeri.
- IDE: IntelliJ IDEA, Eclipse veya herhangi bir Java‑uyumlu editör.
- Maven (isteğe bağlı): Kolay bağımlılık yönetimi için.
Java için GroupDocs.Parser Kurulumu
Maven Kurulumu
Bağımlılıkları Maven ile yönetiyorsanız, depo ve bağımlılığı pom.xml dosyanıza ekleyin:
<repositories>
<repository>
<id>repository.groupdocs.com</id>
<name>GroupDocs Repository</name>
<url>https://releases.groupdocs.com/parser/java/</url>
</repository>
</repositories>
<dependencies>
<dependency>
<groupId>com.groupdocs</groupId>
<artifactId>groupdocs-parser</artifactId>
<version>25.5</version>
</dependency>
</dependencies>
Doğrudan İndirme
Alternatif olarak, GroupDocs.Parser for Java’nın en son sürümünü doğrudan GroupDocs releases adresinden indirin.
Lisans Edinme
Ücretsiz deneme başlatmak için, geçici bir lisans almak üzere GroupDocs web sitesini ziyaret edin. Bu, üretim lisansı satın almadan önce kütüphanenin tam yeteneklerini değerlendirmenizi sağlar.
Temel Başlatma ve Kurulum
Kütüphane sınıf yolunuzda olduğunda, Excel çalışma kitabınıza işaret eden bir Parser örneği oluşturabilirsiniz:
import com.groupdocs.parser.Parser;
import com.groupdocs.parser.data.TextReader;
import com.groupdocs.parser.options.IDocumentInfo;
import com.groupdocs.parser.options.TextOptions;
String excelFilePath = "YOUR_DOCUMENT_DIRECTORY/sample.xlsx";
try (Parser parser = new Parser(excelFilePath)) {
// Your code to work with the document
} catch (Exception e) {
e.printStackTrace();
}
Ortam hazır olduğunda, gerçek çıkarma mantığına dalalım.
Excel Nasıl Ayrıştırılır: Sayfalardan Ham Metin Çıkarma
Adım 1 – Belge Bilgilerini Al
İlk olarak, çalışma kitabı hakkında meta verileri alın, örneğin çalışma sayfalarının (ham sayfalar) sayısı.
IDocumentInfo spreadsheetInfo = parser.getDocumentInfo();
Adım 2 – Her Sayfayı Döngüyle Geç ve Metni Oku
Her sayfayı yineleyin ve ham, biçimlendirilmemiş metni alın. TextOptions(true) bayrağı ham modu etkinleştirir.
for (int p = 0; p < spreadsheetInfo.getRawPageCount(); p++) {
try (TextReader reader = parser.getText(p, new TextOptions(true))) {
String sheetContent = reader.readToEnd();
// Process or use extracted text data here
}
}
Çıkarılan Veriyi İşleme
Bu noktada sheetContent mevcut çalışma sayfasının düz metnini tutar. Şunları yapabilirsiniz:
- Arşivleme için bir
.txtdosyasına yazın. - Doğal dil işleme boru hattına besleyin.
- Daha sonra sorgulama için bir veritabanına kaydedin.
Yaygın Sorunlar ve Çözümler
| Sorun | Neden Oluşur | Çözüm |
|---|---|---|
| Dosya bulunamadı | Yanlış excelFilePath. | Yolu doğrulayın ve dosyanın okunabilir olduğundan emin olun. |
| Desteklenmeyen format | Daha yeni bir ayrıştırıcı sürümüyle eski bir XLS dosyası kullanmak. | Dosyayı XLSX’e dönüştürün veya en son GroupDocs.Parser sürümüne güncelleyin. |
| Büyük çalışma kitaplarında bellek dışı hatalar | Tüm sayfaları bir anda yüklemek. | (Gösterildiği gibi) bir seferde bir sayfa işleyin ve kaynakları hemen serbest bırakın. |
| Lisans istisnası | Deneme süresi dolmuş veya lisans dosyası eksik. | Ayrıştırmadan önce geçerli bir geçici ya da satın alınmış lisans uygulayın. |
Pratik Uygulamalar (Excel Sayfa Metnini Okuma)
- Veri Taşıma: Eski elektronik tablo verilerini manuel kopyala‑yapıştır yapmadan modern veritabanlarına taşıyın.
- Otomatik Raporlama: Birden çok çalışma kitabından ham değerleri çekerek birleştirilmiş PDF veya HTML raporları oluşturun.
- Arama İndeksleme: Çıkarılan metni Elasticsearch’te indeksleyerek hızlı içerik keşfi sağlayın.
Büyük Excel Dosyaları için Performans İpuçları
- Sayfa başına akış: Döngü zaten bir seferde bir sayfa işlediği için bellek kullanımı düşük tutulur.
TextReadernesnelerini yeniden kullanın: Sıkı döngüler içinde gereksiz nesne oluşturmaktan kaçının.- Paralel işleme: Çok büyük çalışma kitapları için sayfaları ayrı iş parçacıklarında işlemeyi düşünün, ancak
Parserörneğiyle ilgili iş parçacığı güvenliğine dikkat edin.
Sıkça Sorulan Sorular
S: GroupDocs.Parser hangi diğer elektronik tablo formatlarını destekliyor?
C: XLSX, XLS, CSV ve diğer Office Open XML formatlarını işler.
S: Hücre biçimlendirme bilgilerini de çıkarabilir miyim?
C: Evet, ham bayrak olmadan TextOptions kullanarak biçimlendirilmiş metni alabilirsiniz.
S: Şifre korumalı Excel dosyalarını nasıl yönetirim?
C: Şifreyi Parser yapıcıya geçirin: new Parser(filePath, "password").
S: Sadece belirli sütunları çıkarmanın bir yolu var mı?
C: Satırları filtrelemek için sheetContent üzerinde son işlem yapabilir veya daha ayrıntılı kontrol için SpreadsheetOptions API’sini kullanabilirsiniz.
S: Daha fazla kod örneği nerede bulunabilir?
C: Ek örnekler için GroupDocs documentation ve GitHub deposuna bakın.
Kaynaklar
- Dokümantasyon: GroupDocs Parser Java Docs
- API Referansı: API Reference
- İndirme: Latest Releases
- GitHub Deposu: GroupDocs.Parser on GitHub
- Ücretsiz Destek Forumu: GroupDocs Parser Forum
- Geçici Lisans: Obtain a Temporary License
Son Güncelleme: 2026-02-14
Test Edilen Versiyon: GroupDocs.Parser 25.5 for Java
Yazar: GroupDocs