/[webpac]/trunk/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /trunk/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 54 by dpavlin, Mon Jun 23 20:20:32 2003 UTC revision 137 by dpavlin, Wed Oct 29 22:57:43 2003 UTC
# Line 18  die "FATAL: can't find configuration fil Line 18  die "FATAL: can't find configuration fil
18    
19  my $config;  my $config;
20    
21  use index_DBI;  # there is no other, right now ;-)  #use index_DBI;         # default DBI module for index
22    use index_DBI_cache;    # faster DBI module using memory cache
23  my $index;  my $index;
24    
25  my %opts;  my %opts;
# Line 33  getopts('d:m:qs', \%opts); Line 34  getopts('d:m:qs', \%opts);
34    
35  my $path;       # this is name of database  my $path;       # this is name of database
36    
37  Text::Iconv->raise_error(1);     # Conversion errors raise exceptions  Text::Iconv->raise_error(0);     # Conversion errors don't raise exceptions
38    
39  # this is encoding of all files on disk, including import_xml/*.xml file and  # this is encoding of all files on disk, including import_xml/*.xml file and
40  # filter/*.pm files! It will be used to store strings in perl internally!  # filter/*.pm files! It will be used to store strings in perl internally!
# Line 55  my $cp2utf = Text::Iconv->new($codepage, Line 56  my $cp2utf = Text::Iconv->new($codepage,
56  # format in XML file  # format in XML file
57  my %type2tag = (  my %type2tag = (
58          'isis' => 'isis',          'isis' => 'isis',
59          'excel' => 'column'          'excel' => 'column',
60            'marc' => 'marc',
61            'feed' => 'feed'
62  );  );
63    
64  sub data2xml {  sub data2xml {
# Line 65  sub data2xml { Line 68  sub data2xml {
68          my $type = shift @_;          my $type = shift @_;
69          my $row = shift @_;          my $row = shift @_;
70          my $add_xml = shift @_;          my $add_xml = shift @_;
71            # needed to read values from configuration file
72            my $cfg = shift @_;
73            my $database = shift @_;
74    
75          my $xml;          my $xml;
76    
# Line 76  sub data2xml { Line 82  sub data2xml {
82    
83          # sort subrouting using order="" attribute          # sort subrouting using order="" attribute
84          sub by_order {          sub by_order {
85                  return 0 if (! $config->{indexer}->{$a}->{order});                  my $va = $config->{indexer}->{$a}->{order} ||
86                  return 0 if (! $config->{indexer}->{$b}->{order});                          $config->{indexer}->{$a};
87                    my $vb = $config->{indexer}->{$b}->{order} ||
88                            $config->{indexer}->{$b};
89    
90                  return $config->{indexer}->{$a}->{order} <=>                  return $va <=> $vb;
                         $config->{indexer}->{$b}->{order} ;  
91          }          }
92    
93          foreach my $field (sort by_order keys %{$config->{indexer}}) {          foreach my $field (sort by_order keys %{$config->{indexer}}) {
94    
95                  $field=x($field);                  $field=x($field);
   
96                  $field_usage{$field}++;                  $field_usage{$field}++;
97    
98                  my $swish_data = "";                  my $swish_data = "";
# Line 118  sub data2xml { Line 124  sub data2xml {
124                          # init vars so that we go into while...                          # init vars so that we go into while...
125                          ($swish,$display) = (1,1);                          ($swish,$display) = (1,1);
126    
127                          if ($swish || $display) {                          # placeholder for all repeatable entries for index
128                            my @index_data;
129                            my $index_filter;
130    
131                            # while because of repeatable fields
132                            while ($swish || $display) {
133                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                    if ($repeat_off > 1000) {
135                                            print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                  # filter="name" ; filter this field through                                  # filter="name" ; filter this field through
140                                  # filter/[name].pm                                  # filter/[name].pm
141                                  my $filter = $x->{filter};                                  my $filter = $x->{filter};
# Line 144  sub data2xml { Line 160  sub data2xml {
160                                          }                                          }
161                                          if ($filter) {                                          if ($filter) {
162                                                  no strict 'refs';                                                  no strict 'refs';
163                                                  $display_data .= join($delimiter,&$filter($display));                                                  $display_data .= $delimiter.&$filter($display) if ($display_data);
164                                          } else {                                          } else {
165                                                  if ($display_data) {                                                  $display_data .= $delimiter.$display if ($display_data);
                                                         $display_data .= $delimiter.$display;  
                                                 } else {  
                                                         $display_data .= $display;  
                                                 }  
166                                          }                                          }
167                                  }                                  }
168                                                                                                    
169                                  # type="index" ; insert into index                                  # type="index" ; insert into index
170                                  if ($i && $display) {                                  if ($i && $display) {
171                                          my $index_data = $display;                                          push @index_data, $display;
172                                          if ($filter) {                                          $index_filter = $filter if ($filter);
173                                                  no strict 'refs';                                  }
174                                                  foreach my $d (&$filter($index_data)) {                          }
175                                                          $index->insert($field, $d, $path);  
176                                                  }                          # fill data in index
177                                          } else {                          if (@index_data) {
178                                                  $index->insert($field, $index_data, $path);                                  if ($index_filter) {
179                                            no strict 'refs';
180                                            foreach my $d (@index_data) {
181                                                    $index->insert($field, &$index_filter($d), $path);
182                                            }
183                                    } else {
184                                            foreach my $d (@index_data) {
185                                                    $index->insert($field, $d, $path);
186                                          }                                          }
187                                  }                                  }
188                          }                          }
189                  }                  }
190    
191                    # now try to parse variables from configuration file
192                    foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {
193    
194                            my $delimiter = x($x->{delimiter}) || ' ';
195                            my $val = $cfg->val($database, x($x->{content}));
196    
197                            my ($s,$d,$i) = (1,1,0);        # swish, display default
198                            $s = 0 if (lc($x->{type}) eq "display");
199                            $d = 0 if (lc($x->{type}) eq "swish");
200                            ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
201    
202                            if ($val) {
203                                    $display_data .= $delimiter.$val if ($d);
204                                    $swish_data .= $val if ($s);
205                                    $index->insert($field, $val, $path) if ($i);
206                            }
207    
208                    }
209    
210    
211                  if ($display_data) {                  if ($display_data) {
212    
# Line 206  sub data2xml { Line 244  sub data2xml {
244    
245          # dump formatted output in <html>          # dump formatted output in <html>
246          if ($html) {          if ($html) {
247                  $xml .= xmlify("html",$html);                  #$xml .= xmlify("html",$html);
248                    $xml .= "<html><![CDATA[ $html ]]></html>";
249          }          }
250                    
251          if ($xml) {          if ($xml) {
# Line 233  $index = new index_DBI( Line 272  $index = new index_DBI(
272                  $cfg_global->val('global', 'dbi_passwd') || '',                  $cfg_global->val('global', 'dbi_passwd') || '',
273          );          );
274    
275    my $show_progress = $cfg_global->val('global', 'show_progress');
276    
277  foreach my $database ($cfg->Sections) {  foreach my $database ($cfg->Sections) {
278    
279          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
# Line 240  foreach my $database ($cfg->Sections) { Line 281  foreach my $database ($cfg->Sections) {
281    
282  print STDERR "reading ./import_xml/$type.xml\n";  print STDERR "reading ./import_xml/$type.xml\n";
283    
284          $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type} ], forcecontent => 1);          # extract just type basic
285            my $type_base = $type;
286            $type_base =~ s/_.+$//g;
287    
288            $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type_base}, 'config' ], forcecontent => 1);
289    
290          # output current progress indicator          # output current progress indicator
291          my $last_p = 0;          my $last_p = 0;
292          sub progress {          sub progress {
293                  #return if (! $opts{q});        # FIXME                  return if (! $show_progress);
294                  my $current = shift;                  my $current = shift;
295                  my $total = shift;                  my $total = shift || 1;
296                  my $p = int($current * 100 / $total);                  my $p = int($current * 100 / $total);
297                  if ($p != $last_p) {                  if ($p != $last_p) {
298                          printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$current,$total,"=" x ($p/2).">", $p );                          printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$current,$total,"=" x ($p/2).">", $p );
# Line 255  print STDERR "reading ./import_xml/$type Line 300  print STDERR "reading ./import_xml/$type
300                  }                  }
301          }          }
302    
303            my $fake_dir = 1;
304            sub fakeprogress {
305                    return if (! $show_progress);
306                    my $current = shift @_;
307    
308                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
309    
310                    $last_p += $fake_dir;
311                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
312                    if ($last_p % 10 == 0) {
313                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
314                    }
315            }
316    
317          # now read database          # now read database
318  print STDERR "using: $type...\n";  print STDERR "using: $type...\n";
319    
320          if ($type eq "isis") {          if ($type_base eq "isis") {
321    
322                  my $isis_db = $cfg -> val($database, 'isis_db') || die "$database doesn't have 'isis_db' defined!";                  my $isis_db = $cfg -> val($database, 'isis_db') || die "$database doesn't have 'isis_db' defined!";
323    
324                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);
325                  my $db = OpenIsis::open( $isis_db );                  my $db = OpenIsis::open( $isis_db );
326    
327                    # check if .txt database for OpenIsis is zero length,
328                    # if so, erase it and re-open database
329                    sub check_txt_db {
330                            my $isis_db = shift || die "need isis database name";
331                            my $reopen = 0;
332    
333                            if (-e $isis_db.".TXT") {
334                                    print STDERR "WARNING: removing $isis_db.TXT OpenIsis database...\n";
335                                    unlink $isis_db.".TXT" || warn "FATAL: unlink error on '$isis_db.TXT': $!";
336                                    $reopen++;
337                            }
338                            if (-e $isis_db.".PTR") {
339                                    print STDERR "WARNING: removing $isis_db.PTR OpenIsis database...\n";
340                                    unlink $isis_db.".PTR" || warn "FATAL: unlink error on '$isis_db.PTR': $!";
341                                    $reopen++;
342                            }
343                            return OpenIsis::open( $isis_db ) if ($reopen);
344                    }
345    
346                    # EOF error
347                    if ($db == -1) {
348                            $db = check_txt_db($isis_db);
349                            if ($db == -1) {
350                                    print STDERR "FATAL: OpenIsis can't open zero size file $isis_db\n";
351                                    next;
352                            }
353                    }
354    
355                    # OpenIsis::ERR_BADF
356                    if ($db == -4) {
357                            print STDERR "FATAL: OpenIsis can't find file $isis_db\n";
358                            next;
359                    # OpenIsis::ERR_IO
360                    } elsif ($db == -5) {
361                            print STDERR "FATAL: OpenIsis can't access file $isis_db\n";
362                            next;
363                    } elsif ($db < 0) {
364                            print STDERR "FATAL: OpenIsis unknown error $db with file $isis_db\n";
365                            next;
366                    }
367    
368                  my $max_rowid = OpenIsis::maxRowid( $db );                  my $max_rowid = OpenIsis::maxRowid( $db );
369    
370                    # if 0 records, try to rease isis .txt database
371                    if ($max_rowid == 0) {
372                            # force removal of database
373                            $db = check_txt_db($isis_db);
374                            $max_rowid = OpenIsis::maxRowid( $db );
375                    }
376    
377                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";
378    
379                  my $path = $database;                  my $path = $database;
# Line 278  print STDERR "using: $type...\n"; Line 386  print STDERR "using: $type...\n";
386    
387                                  my $swishpath = $path."#".int($row->{mfn});                                  my $swishpath = $path."#".int($row->{mfn});
388    
389                                  if (my $xml = data2xml($type,$row,$add_xml)) {                                  if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
390                                          $xml = $cp2utf->convert($xml);                                          $xml = $cp2utf->convert($xml);
391                                          use bytes;      # as opposed to chars                                          use bytes;      # as opposed to chars
392                                          print "Path-Name: $swishpath\n";                                          print "Path-Name: $swishpath\n";
# Line 287  print STDERR "using: $type...\n"; Line 395  print STDERR "using: $type...\n";
395                                  }                                  }
396                          }                          }
397                  }                  }
398                    # for this to work with current version of OpenIsis (0.9.0)
399                    # you might need my patch from
400                    # http://www.rot13.org/~dpavlin/projects/openisis-0.9.0-perl_close.diff
401                    OpenIsis::close($db);
402                  print STDERR "\n";                  print STDERR "\n";
403    
404          } elsif ($type eq "excel") {          } elsif ($type_base eq "excel") {
405                  use Spreadsheet::ParseExcel;                  use Spreadsheet::ParseExcel;
406                  use Spreadsheet::ParseExcel::Utility qw(int2col);                  use Spreadsheet::ParseExcel::Utility qw(int2col);
407                                    
# Line 297  print STDERR "using: $type...\n"; Line 409  print STDERR "using: $type...\n";
409                  my $excel_file = $cfg -> val($database, 'excel_file') || die "$database doesn't have 'excel_file' defined!";                  my $excel_file = $cfg -> val($database, 'excel_file') || die "$database doesn't have 'excel_file' defined!";
410    
411                  my $sheet = x($config->{sheet}) || die "no sheet in $type.xml";                  my $sheet = x($config->{sheet}) || die "no sheet in $type.xml";
412                  my $start_row = x($config->{start_row}) || die "no start_row in $type.xml";                  my $start_row = x($config->{start_row}) - 1 || die "no start_row in $type.xml";
413    
414                  my $oBook = Spreadsheet::ParseExcel::Workbook->Parse($excel_file) || die "can't open Excel file '$excel_file'";                  my $oBook = Spreadsheet::ParseExcel::Workbook->Parse($excel_file) || die "can't open Excel file '$excel_file'";
415    
# Line 314  print STDERR "using: $type...\n"; Line 426  print STDERR "using: $type...\n";
426                  defined ($oWorksheet) || die "can't find sheet '$sheet' in $excel_file";                  defined ($oWorksheet) || die "can't find sheet '$sheet' in $excel_file";
427                  my $end_row = x($config->{end_row}) || $oWorksheet->{MaxRow};                  my $end_row = x($config->{end_row}) || $oWorksheet->{MaxRow};
428    
429                  for(my $iR = $oWorksheet->{MinRow} ; defined $end_row && $iR <= $end_row ; $iR++) {                  for(my $iR = $start_row ; defined $end_row && $iR <= $end_row ; $iR++) {
430                          my $row;                          my $row;
431                          for(my $iC = $oWorksheet->{MinCol} ; defined $oWorksheet->{MaxCol} && $iC <= $oWorksheet->{MaxCol} ; $iC++) {                          for(my $iC = $oWorksheet->{MinCol} ; defined $oWorksheet->{MaxCol} && $iC <= $oWorksheet->{MaxCol} ; $iC++) {
432                                  my $cell = $oWorksheet->{Cells}[$iR][$iC];                                  my $cell = $oWorksheet->{Cells}[$iR][$iC];
# Line 335  print STDERR "using: $type...\n"; Line 447  print STDERR "using: $type...\n";
447    
448                          next if (! $row);                          next if (! $row);
449    
450                          if (my $xml = data2xml($type,$row,$add_xml)) {                          if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
451                                    $xml = $cp2utf->convert($xml);
452                                    use bytes;      # as opposed to chars
453                                    print "Path-Name: $swishpath\n";
454                                    print "Content-Length: ".(length($xml)+1)."\n";
455                                    print "Document-Type: XML\n\n$xml\n";
456                            }
457                    }
458            } elsif ($type_base eq "marc") {
459    
460                    use MARC;
461                    
462                    $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
463                    my $marc_file = $cfg -> val($database, 'marc_file') || die "$database doesn't have 'marc_file' defined!";
464    
465                    # optional argument is format
466                    my $format = x($config->{format}) || 'usmarc';
467    
468                    print STDERR "Reading MARC file '$marc_file'\n";
469    
470                    my $marc = new MARC;
471                    my $nr = $marc->openmarc({
472                                    file=>$marc_file, format=>$format
473                            }) || die "Can't open MARC file '$marc_file'";
474    
475                    my $i=0;        # record nr.
476    
477                    my $rec;
478    
479                    while ($marc->nextmarc(1)) {
480    
481                            # XXX
482                            fakeprogress($i++);
483    
484                            my $swishpath = $database."#".$i;
485    
486                            if (my $xml = data2xml($type_base,$marc,$add_xml,$cfg,$database)) {
487                                  $xml = $cp2utf->convert($xml);                                  $xml = $cp2utf->convert($xml);
488                                  use bytes;      # as opposed to chars                                  use bytes;      # as opposed to chars
489                                  print "Path-Name: $swishpath\n";                                  print "Path-Name: $swishpath\n";
# Line 343  print STDERR "using: $type...\n"; Line 491  print STDERR "using: $type...\n";
491                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
492                          }                          }
493                  }                  }
494            } elsif ($type_base eq "feed") {
495    
496                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
497                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
498    
499                    print STDERR "Reading feed from program '$prog'\n";
500    
501                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
502    
503                    my $i=1;        # record nr.
504    
505                    my $data;
506                    my $line=1;
507    
508                    while (<FEED>) {
509                            chomp;
510    
511                            if (/^$/) {
512                                    my $swishpath = $database."#".$i++;
513    
514                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
515                                            $xml = $cp2utf->convert($xml);
516                                            use bytes;      # as opposed to chars
517                                            print "Path-Name: $swishpath\n";
518                                            print "Content-Length: ".(length($xml)+1)."\n";
519                                            print "Document-Type: XML\n\n$xml\n";
520                                    }
521                                    $line = 1;
522                                    $data = {};
523                                    next;
524                            }
525    
526                            $line = $1 if (s/^(\d+):\s*//);
527                            $data->{$line++} = $_;
528    
529                            fakeprogress($i);
530    
531                    }
532          }          }
533  }  }
534    
# Line 355  __END__ Line 541  __END__
541    
542  =head1 NAME  =head1 NAME
543    
544  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
545    
546  =head1 DESCRIPTION  =head1 DESCRIPTION
547    
548  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
549  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
550  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
551  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
552  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
553    
554    =head1 BUGS
555    
556    Documentation is really lacking. However, in true Open Source spirit, source
557    is best documentation. I even made considerable effort to comment parts
558    which are not intuitively clear, so...
559    
560  =head1 AUTHOR  =head1 AUTHOR
561    

Legend:
Removed from v.54  
changed lines
  Added in v.137

  ViewVC Help
Powered by ViewVC 1.1.26