/[webpac]/branches/ffzg/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /branches/ffzg/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 56 by dpavlin, Wed Jun 25 12:09:27 2003 UTC revision 106 by dpavlin, Mon Jul 14 17:09:36 2003 UTC
# Line 18  die "FATAL: can't find configuration fil Line 18  die "FATAL: can't find configuration fil
18    
19  my $config;  my $config;
20    
21  use index_DBI;  # there is no other, right now ;-)  #use index_DBI;         # default DBI module for index
22    use index_DBI_cache;    # faster DBI module using memory cache
23  my $index;  my $index;
24    
25  my %opts;  my %opts;
# Line 33  getopts('d:m:qs', \%opts); Line 34  getopts('d:m:qs', \%opts);
34    
35  my $path;       # this is name of database  my $path;       # this is name of database
36    
37  Text::Iconv->raise_error(1);     # Conversion errors raise exceptions  Text::Iconv->raise_error(0);     # Conversion errors don't raise exceptions
38    
39  # this is encoding of all files on disk, including import_xml/*.xml file and  # this is encoding of all files on disk, including import_xml/*.xml file and
40  # filter/*.pm files! It will be used to store strings in perl internally!  # filter/*.pm files! It will be used to store strings in perl internally!
# Line 55  my $cp2utf = Text::Iconv->new($codepage, Line 56  my $cp2utf = Text::Iconv->new($codepage,
56  # format in XML file  # format in XML file
57  my %type2tag = (  my %type2tag = (
58          'isis' => 'isis',          'isis' => 'isis',
59          'excel' => 'column'          'excel' => 'column',
60            'marc' => 'marc',
61            'feed' => 'feed'
62  );  );
63    
64  sub data2xml {  sub data2xml {
# Line 65  sub data2xml { Line 68  sub data2xml {
68          my $type = shift @_;          my $type = shift @_;
69          my $row = shift @_;          my $row = shift @_;
70          my $add_xml = shift @_;          my $add_xml = shift @_;
71            # needed to read values from configuration file
72            my $cfg = shift @_;
73            my $database = shift @_;
74    
75          my $xml;          my $xml;
76    
# Line 76  sub data2xml { Line 82  sub data2xml {
82    
83          # sort subrouting using order="" attribute          # sort subrouting using order="" attribute
84          sub by_order {          sub by_order {
85                  return 0 if (! $config->{indexer}->{$a}->{order});                  my $va = $config->{indexer}->{$a}->{order} ||
86                  return 0 if (! $config->{indexer}->{$b}->{order});                          $config->{indexer}->{$a};
87                    my $vb = $config->{indexer}->{$b}->{order} ||
88                            $config->{indexer}->{$b};
89    
90                  return $config->{indexer}->{$a}->{order} <=>                  return $va <=> $vb;
                         $config->{indexer}->{$b}->{order} ;  
91          }          }
92    
93          foreach my $field (sort by_order keys %{$config->{indexer}}) {          foreach my $field (sort by_order keys %{$config->{indexer}}) {
94    
95                  $field=x($field);                  $field=x($field);
   
96                  $field_usage{$field}++;                  $field_usage{$field}++;
97    
98                  my $swish_data = "";                  my $swish_data = "";
# Line 118  sub data2xml { Line 124  sub data2xml {
124                          # init vars so that we go into while...                          # init vars so that we go into while...
125                          ($swish,$display) = (1,1);                          ($swish,$display) = (1,1);
126    
127                          if ($swish || $display) {                          # placeholder for all repeatable entries for index
128                            my @index_data;
129                            my $index_filter;
130    
131                            # while because of repeatable fields
132                            while ($swish || $display) {
133                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                    if ($repeat_off > 1000) {
135                                            print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                  # filter="name" ; filter this field through                                  # filter="name" ; filter this field through
140                                  # filter/[name].pm                                  # filter/[name].pm
141                                  my $filter = $x->{filter};                                  my $filter = $x->{filter};
# Line 156  sub data2xml { Line 172  sub data2xml {
172                                                                                                    
173                                  # type="index" ; insert into index                                  # type="index" ; insert into index
174                                  if ($i && $display) {                                  if ($i && $display) {
175                                          my $index_data = $display;                                          push @index_data, $display;
176                                          if ($filter) {                                          $index_filter = $filter if ($filter);
177                                                  no strict 'refs';                                  }
178                                                  foreach my $d (&$filter($index_data)) {                          }
179                                                          $index->insert($field, $d, $path);  
180                                                  }                          # fill data in index
181                                          } else {                          if (@index_data) {
182                                                  $index->insert($field, $index_data, $path);                                  if ($index_filter) {
183                                            no strict 'refs';
184                                            foreach my $d (&$index_filter(@index_data)) {
185                                                    $index->insert($field, $d, $path);
186                                            }
187                                    } else {
188                                            foreach my $d (@index_data) {
189                                                    $index->insert($field, $d, $path);
190                                          }                                          }
191                                  }                                  }
192                          }                          }
193                  }                  }
194    
195                    # now try to parse variables from configuration file
196                    foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {
197    
198                            my $delimiter = x($x->{delimiter}) || ' ';
199                            my $val = $cfg->val($database, x($x->{content}));
200    
201                            my ($s,$d,$i) = (1,1,0);        # swish, display default
202                            $s = 0 if (lc($x->{type}) eq "display");
203                            $d = 0 if (lc($x->{type}) eq "swish");
204                            ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
205    
206                            if ($val) {
207                                    $display_data .= $delimiter.$val if ($d);
208                                    $swish_data .= $val if ($s);
209                                    $index->insert($field, $val, $path) if ($i);
210                            }
211    
212                    }
213    
214    
215                  if ($display_data) {                  if ($display_data) {
216    
# Line 206  sub data2xml { Line 248  sub data2xml {
248    
249          # dump formatted output in <html>          # dump formatted output in <html>
250          if ($html) {          if ($html) {
251                  $xml .= xmlify("html",$html);                  #$xml .= xmlify("html",$html);
252                    $xml .= "<html><![CDATA[ $html ]]></html>";
253          }          }
254                    
255          if ($xml) {          if ($xml) {
# Line 233  $index = new index_DBI( Line 276  $index = new index_DBI(
276                  $cfg_global->val('global', 'dbi_passwd') || '',                  $cfg_global->val('global', 'dbi_passwd') || '',
277          );          );
278    
279    my $show_progress = $cfg_global->val('global', 'show_progress');
280    
281  foreach my $database ($cfg->Sections) {  foreach my $database ($cfg->Sections) {
282    
283          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
# Line 240  foreach my $database ($cfg->Sections) { Line 285  foreach my $database ($cfg->Sections) {
285    
286  print STDERR "reading ./import_xml/$type.xml\n";  print STDERR "reading ./import_xml/$type.xml\n";
287    
288          $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type} ], forcecontent => 1);          # extract just type basic
289            my $type_base = $type;
290            $type_base =~ s/_.+$//g;
291    
292            $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type_base}, 'config' ], forcecontent => 1);
293    
294          # output current progress indicator          # output current progress indicator
295          my $last_p = 0;          my $last_p = 0;
296          sub progress {          sub progress {
297                  #return if (! $opts{q});        # FIXME                  return if (! $show_progress);
298                  my $current = shift;                  my $current = shift;
299                  my $total = shift;                  my $total = shift || 1;
300                  my $p = int($current * 100 / $total);                  my $p = int($current * 100 / $total);
301                  if ($p != $last_p) {                  if ($p != $last_p) {
302                          printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$current,$total,"=" x ($p/2).">", $p );                          printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$current,$total,"=" x ($p/2).">", $p );
# Line 255  print STDERR "reading ./import_xml/$type Line 304  print STDERR "reading ./import_xml/$type
304                  }                  }
305          }          }
306    
307            my $fake_dir = 1;
308            sub fakeprogress {
309                    return if (! $show_progress);
310                    my $current = shift @_;
311    
312                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
313    
314                    $last_p += $fake_dir;
315                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
316                    if ($last_p % 10 == 0) {
317                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
318                    }
319            }
320    
321          # now read database          # now read database
322  print STDERR "using: $type...\n";  print STDERR "using: $type...\n";
323    
324          if ($type eq "isis") {          if ($type_base eq "isis") {
325    
326                  my $isis_db = $cfg -> val($database, 'isis_db') || die "$database doesn't have 'isis_db' defined!";                  my $isis_db = $cfg -> val($database, 'isis_db') || die "$database doesn't have 'isis_db' defined!";
327    
328                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);
329                  my $db = OpenIsis::open( $isis_db );                  my $db = OpenIsis::open( $isis_db );
330    
331                    # check if .txt database for OpenIsis is zero length,
332                    # if so, erase it and re-open database
333                    sub check_txt_db {
334                            my $isis_db = shift || die "need isis database name";
335                            if (-e $isis_db.".TXT") {
336                                    print STDERR "WARNING: removing .txt OpenIsis database...\n";
337                                    unlink $isis_db.".TXT" || warn "unlink error on '$isis_db.TXT': $!";
338                                    my $db = OpenIsis::open( $isis_db );
339                                    return $db;
340                            }
341                    }
342    
343                    # EOF error
344                    if ($db == -1) {
345                            $db = check_txt_db($isis_db);
346                            if (! $db) {
347                                    print STDERR "FATAL: OpenIsis can't open zero size file $isis_db\n";
348                                    next;
349                            }
350                    }
351    
352                    # OpenIsis::ERR_BADF
353                    if ($db == -4) {
354                            print STDERR "FATAL: OpenIsis can't find file $isis_db\n";
355                            next;
356                    # OpenIsis::ERR_IO
357                    } elsif ($db == -5) {
358                            print STDERR "FATAL: OpenIsis can't access file $isis_db\n";
359                            next;
360                    } elsif ($db < 0) {
361                            print STDERR "FATAL: OpenIsis unknown error $db with file $isis_db\n";
362                            next;
363                    }
364    
365                  my $max_rowid = OpenIsis::maxRowid( $db );                  my $max_rowid = OpenIsis::maxRowid( $db );
366    
367                    # if 0 records, try to rease isis .txt database
368                    if ($max_rowid == 0) {
369                            # force removal of database
370                            $db = check_txt_db($isis_db);
371                            $max_rowid = OpenIsis::maxRowid( $db );
372                    }
373    
374                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";
375    
376                  my $path = $database;                  my $path = $database;
# Line 278  print STDERR "using: $type...\n"; Line 383  print STDERR "using: $type...\n";
383    
384                                  my $swishpath = $path."#".int($row->{mfn});                                  my $swishpath = $path."#".int($row->{mfn});
385    
386                                  if (my $xml = data2xml($type,$row,$add_xml)) {                                  if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
387                                          $xml = $cp2utf->convert($xml);                                          $xml = $cp2utf->convert($xml);
388                                          use bytes;      # as opposed to chars                                          use bytes;      # as opposed to chars
389                                          print "Path-Name: $swishpath\n";                                          print "Path-Name: $swishpath\n";
# Line 289  print STDERR "using: $type...\n"; Line 394  print STDERR "using: $type...\n";
394                  }                  }
395                  print STDERR "\n";                  print STDERR "\n";
396    
397          } elsif ($type eq "excel") {          } elsif ($type_base eq "excel") {
398                  use Spreadsheet::ParseExcel;                  use Spreadsheet::ParseExcel;
399                  use Spreadsheet::ParseExcel::Utility qw(int2col);                  use Spreadsheet::ParseExcel::Utility qw(int2col);
400                                    
# Line 335  print STDERR "using: $type...\n"; Line 440  print STDERR "using: $type...\n";
440    
441                          next if (! $row);                          next if (! $row);
442    
443                          if (my $xml = data2xml($type,$row,$add_xml)) {                          if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
444                                    $xml = $cp2utf->convert($xml);
445                                    use bytes;      # as opposed to chars
446                                    print "Path-Name: $swishpath\n";
447                                    print "Content-Length: ".(length($xml)+1)."\n";
448                                    print "Document-Type: XML\n\n$xml\n";
449                            }
450                    }
451            } elsif ($type_base eq "marc") {
452    
453                    use MARC;
454                    
455                    $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
456                    my $marc_file = $cfg -> val($database, 'marc_file') || die "$database doesn't have 'marc_file' defined!";
457    
458                    # optional argument is format
459                    my $format = x($config->{format}) || 'usmarc';
460    
461                    print STDERR "Reading MARC file '$marc_file'\n";
462    
463                    my $marc = new MARC;
464                    my $nr = $marc->openmarc({
465                                    file=>$marc_file, format=>$format
466                            }) || die "Can't open MARC file '$marc_file'";
467    
468                    my $i=0;        # record nr.
469    
470                    my $rec;
471    
472                    while ($marc->nextmarc(1)) {
473    
474                            # XXX
475                            fakeprogress($i++);
476    
477                            my $swishpath = $database."#".$i;
478    
479                            if (my $xml = data2xml($type_base,$marc,$add_xml,$cfg,$database)) {
480                                  $xml = $cp2utf->convert($xml);                                  $xml = $cp2utf->convert($xml);
481                                  use bytes;      # as opposed to chars                                  use bytes;      # as opposed to chars
482                                  print "Path-Name: $swishpath\n";                                  print "Path-Name: $swishpath\n";
# Line 343  print STDERR "using: $type...\n"; Line 484  print STDERR "using: $type...\n";
484                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
485                          }                          }
486                  }                  }
487            } elsif ($type_base eq "feed") {
488    
489                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
490                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
491    
492                    print STDERR "Reading feed from program '$prog'\n";
493    
494                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
495    
496                    my $i=1;        # record nr.
497    
498                    my $data;
499                    my $line=1;
500    
501                    while (<FEED>) {
502                            chomp;
503    
504                            if (/^$/) {
505                                    my $swishpath = $database."#".$i++;
506    
507                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
508                                            $xml = $cp2utf->convert($xml);
509                                            use bytes;      # as opposed to chars
510                                            print "Path-Name: $swishpath\n";
511                                            print "Content-Length: ".(length($xml)+1)."\n";
512                                            print "Document-Type: XML\n\n$xml\n";
513                                    }
514                                    $line = 1;
515                                    $data = {};
516                                    next;
517                            }
518    
519                            $line = $1 if (s/^(\d+):\s*//);
520                            $data->{$line++} = $_;
521    
522                            fakeprogress($i);
523    
524                    }
525          }          }
526  }  }
527    
# Line 355  __END__ Line 534  __END__
534    
535  =head1 NAME  =head1 NAME
536    
537  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
538    
539  =head1 DESCRIPTION  =head1 DESCRIPTION
540    
541  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
542  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
543  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
544  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
545  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
546    
547    =head1 BUGS
548    
549    Documentation is really lacking. However, in true Open Source spirit, source
550    is best documentation. I even made considerable effort to comment parts
551    which are not intuitively clear, so...
552    
553  =head1 AUTHOR  =head1 AUTHOR
554    

Legend:
Removed from v.56  
changed lines
  Added in v.106

  ViewVC Help
Powered by ViewVC 1.1.26