/[webpac]/trunk/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /trunk/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 58 by dpavlin, Fri Jul 4 16:56:40 2003 UTC revision 101 by dpavlin, Mon Jul 14 10:52:13 2003 UTC
# Line 56  my $cp2utf = Text::Iconv->new($codepage, Line 56  my $cp2utf = Text::Iconv->new($codepage,
56  # format in XML file  # format in XML file
57  my %type2tag = (  my %type2tag = (
58          'isis' => 'isis',          'isis' => 'isis',
59          'excel' => 'column'          'excel' => 'column',
60            'marc' => 'marc',
61            'feed' => 'feed'
62  );  );
63    
64  sub data2xml {  sub data2xml {
# Line 66  sub data2xml { Line 68  sub data2xml {
68          my $type = shift @_;          my $type = shift @_;
69          my $row = shift @_;          my $row = shift @_;
70          my $add_xml = shift @_;          my $add_xml = shift @_;
71            # needed to read values from configuration file
72            my $cfg = shift @_;
73            my $database = shift @_;
74    
75          my $xml;          my $xml;
76    
# Line 77  sub data2xml { Line 82  sub data2xml {
82    
83          # sort subrouting using order="" attribute          # sort subrouting using order="" attribute
84          sub by_order {          sub by_order {
85                  return 0 if (! $config->{indexer}->{$a}->{order});                  my $va = $config->{indexer}->{$a}->{order} ||
86                  return 0 if (! $config->{indexer}->{$b}->{order});                          $config->{indexer}->{$a};
87                    my $vb = $config->{indexer}->{$b}->{order} ||
88                            $config->{indexer}->{$b};
89    
90                  return $config->{indexer}->{$a}->{order} <=>                  return $va <=> $vb;
                         $config->{indexer}->{$b}->{order} ;  
91          }          }
92    
93          foreach my $field (sort by_order keys %{$config->{indexer}}) {          foreach my $field (sort by_order keys %{$config->{indexer}}) {
94    
95                  $field=x($field);                  $field=x($field);
   
96                  $field_usage{$field}++;                  $field_usage{$field}++;
97    
98                  my $swish_data = "";                  my $swish_data = "";
# Line 119  sub data2xml { Line 124  sub data2xml {
124                          # init vars so that we go into while...                          # init vars so that we go into while...
125                          ($swish,$display) = (1,1);                          ($swish,$display) = (1,1);
126    
127                          if ($swish || $display) {                          # placeholder for all repeatable entries for index
128                            my @index_data;
129                            my $index_filter;
130    
131                            # while because of repeatable fields
132                            while ($swish || $display) {
133                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                    if ($repeat_off > 1000) {
135                                            print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                  # filter="name" ; filter this field through                                  # filter="name" ; filter this field through
140                                  # filter/[name].pm                                  # filter/[name].pm
141                                  my $filter = $x->{filter};                                  my $filter = $x->{filter};
# Line 157  sub data2xml { Line 172  sub data2xml {
172                                                                                                    
173                                  # type="index" ; insert into index                                  # type="index" ; insert into index
174                                  if ($i && $display) {                                  if ($i && $display) {
175                                          my $index_data = $display;                                          push @index_data, $display;
176                                          if ($filter) {                                          $index_filter = $filter if ($filter);
177                                                  no strict 'refs';                                  }
178                                                  foreach my $d (&$filter($index_data)) {                          }
179                                                          $index->insert($field, $d, $path);  
180                                                  }                          # fill data in index
181                                          } else {                          if (@index_data) {
182                                                  $index->insert($field, $index_data, $path);                                  if ($index_filter) {
183                                            no strict 'refs';
184                                            foreach my $d (&$index_filter(@index_data)) {
185                                                    $index->insert($field, $d, $path);
186                                            }
187                                    } else {
188                                            foreach my $d (@index_data) {
189                                                    $index->insert($field, $d, $path);
190                                          }                                          }
191                                  }                                  }
192                          }                          }
193                  }                  }
194    
195                    # now try to parse variables from configuration file
196                    foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {
197    
198                            my $delimiter = x($x->{delimiter}) || ' ';
199                            my $val = $cfg->val($database, x($x->{content}));
200    
201                            my ($s,$d,$i) = (1,1,0);        # swish, display default
202                            $s = 0 if (lc($x->{type}) eq "display");
203                            $d = 0 if (lc($x->{type}) eq "swish");
204                            ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
205    
206                            if ($val) {
207                                    $display_data .= $delimiter.$val if ($d);
208                                    $swish_data .= $val if ($s);
209                                    $index->insert($field, $val, $path) if ($i);
210                            }
211    
212                    }
213    
214    
215                  if ($display_data) {                  if ($display_data) {
216    
# Line 207  sub data2xml { Line 248  sub data2xml {
248    
249          # dump formatted output in <html>          # dump formatted output in <html>
250          if ($html) {          if ($html) {
251                  $xml .= xmlify("html",$html);                  #$xml .= xmlify("html",$html);
252                    $xml .= "<html><![CDATA[ $html ]]></html>";
253          }          }
254                    
255          if ($xml) {          if ($xml) {
# Line 234  $index = new index_DBI( Line 276  $index = new index_DBI(
276                  $cfg_global->val('global', 'dbi_passwd') || '',                  $cfg_global->val('global', 'dbi_passwd') || '',
277          );          );
278    
279    my $show_progress = $cfg_global->val('global', 'show_progress');
280    
281  foreach my $database ($cfg->Sections) {  foreach my $database ($cfg->Sections) {
282    
283          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
# Line 245  print STDERR "reading ./import_xml/$type Line 289  print STDERR "reading ./import_xml/$type
289          my $type_base = $type;          my $type_base = $type;
290          $type_base =~ s/_.+$//g;          $type_base =~ s/_.+$//g;
291    
292          $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type_base} ], forcecontent => 1);          $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type_base}, 'config' ], forcecontent => 1);
293    
294          # output current progress indicator          # output current progress indicator
295          my $last_p = 0;          my $last_p = 0;
296    print STDERR "## show_progress: $show_progress ##\n"; # XXX
297          sub progress {          sub progress {
298                  #return if (! $opts{q});        # FIXME                  return if (! $show_progress);
299                  my $current = shift;                  my $current = shift;
300                  my $total = shift || 1;                  my $total = shift || 1;
301                  my $p = int($current * 100 / $total);                  my $p = int($current * 100 / $total);
# Line 260  print STDERR "reading ./import_xml/$type Line 305  print STDERR "reading ./import_xml/$type
305                  }                  }
306          }          }
307    
308            my $fake_dir = 1;
309            sub fakeprogress {
310                    my $current = shift @_;
311    
312                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
313    
314                    $last_p += $fake_dir;
315                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
316                    if ($last_p % 10 == 0) {
317                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
318                    }
319            }
320    
321          # now read database          # now read database
322  print STDERR "using: $type...\n";  print STDERR "using: $type...\n";
323    
# Line 270  print STDERR "using: $type...\n"; Line 328  print STDERR "using: $type...\n";
328                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);
329                  my $db = OpenIsis::open( $isis_db );                  my $db = OpenIsis::open( $isis_db );
330    
331                    # OpenIsis::ERR_BADF
332                    if ($db == -4) {
333                            print STDERR "FATAL: OpenIsis can't find file $isis_db\n";
334                            next;
335                    # OpenIsis::ERR_IO
336                    } elsif ($db == -5) {
337                            print STDERR "FATAL: OpenIsis can't access file $isis_db\n";
338                            next;
339                    } elsif ($db < 0) {
340                            print STDERR "FATAL: OpenIsis unknown error $db with file $isis_db\n";
341                            next;
342                    }
343    
344                  my $max_rowid = OpenIsis::maxRowid( $db );                  my $max_rowid = OpenIsis::maxRowid( $db );
345    
346                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";
# Line 284  print STDERR "using: $type...\n"; Line 355  print STDERR "using: $type...\n";
355    
356                                  my $swishpath = $path."#".int($row->{mfn});                                  my $swishpath = $path."#".int($row->{mfn});
357    
358                                  if (my $xml = data2xml($type_base,$row,$add_xml)) {                                  if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
359                                          $xml = $cp2utf->convert($xml);                                          $xml = $cp2utf->convert($xml);
360                                          use bytes;      # as opposed to chars                                          use bytes;      # as opposed to chars
361                                          print "Path-Name: $swishpath\n";                                          print "Path-Name: $swishpath\n";
# Line 341  print STDERR "using: $type...\n"; Line 412  print STDERR "using: $type...\n";
412    
413                          next if (! $row);                          next if (! $row);
414    
415                          if (my $xml = data2xml($type,$row,$add_xml)) {                          if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
416                                  $xml = $cp2utf->convert($xml);                                  $xml = $cp2utf->convert($xml);
417                                  use bytes;      # as opposed to chars                                  use bytes;      # as opposed to chars
418                                  print "Path-Name: $swishpath\n";                                  print "Path-Name: $swishpath\n";
# Line 349  print STDERR "using: $type...\n"; Line 420  print STDERR "using: $type...\n";
420                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
421                          }                          }
422                  }                  }
423            } elsif ($type_base eq "marc") {
424    
425                    use MARC;
426                    
427                    $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
428                    my $marc_file = $cfg -> val($database, 'marc_file') || die "$database doesn't have 'marc_file' defined!";
429    
430                    # optional argument is format
431                    my $format = x($config->{format}) || 'usmarc';
432    
433                    print STDERR "Reading MARC file '$marc_file'\n";
434    
435                    my $marc = new MARC;
436                    my $nr = $marc->openmarc({
437                                    file=>$marc_file, format=>$format
438                            }) || die "Can't open MARC file '$marc_file'";
439    
440                    my $i=0;        # record nr.
441    
442                    my $rec;
443    
444                    while ($marc->nextmarc(1)) {
445    
446                            # XXX
447                            fakeprogress($i++);
448    
449                            my $swishpath = $database."#".$i;
450    
451                            if (my $xml = data2xml($type_base,$marc,$add_xml,$cfg,$database)) {
452                                    $xml = $cp2utf->convert($xml);
453                                    use bytes;      # as opposed to chars
454                                    print "Path-Name: $swishpath\n";
455                                    print "Content-Length: ".(length($xml)+1)."\n";
456                                    print "Document-Type: XML\n\n$xml\n";
457                            }
458                    }
459            } elsif ($type_base eq "feed") {
460    
461                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
462                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
463    
464                    print STDERR "Reading feed from program '$prog'\n";
465    
466                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
467    
468                    my $i=1;        # record nr.
469    
470                    my $data;
471                    my $line=1;
472    
473                    while (<FEED>) {
474                            chomp;
475    
476                            if (/^$/) {
477                                    my $swishpath = $database."#".$i++;
478    
479                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
480                                            $xml = $cp2utf->convert($xml);
481                                            use bytes;      # as opposed to chars
482                                            print "Path-Name: $swishpath\n";
483                                            print "Content-Length: ".(length($xml)+1)."\n";
484                                            print "Document-Type: XML\n\n$xml\n";
485                                    }
486                                    $line = 1;
487                                    $data = {};
488                                    next;
489                            }
490    
491                            $line = $1 if (s/^(\d+):\s*//);
492                            $data->{$line++} = $_;
493    
494                            fakeprogress($i);
495    
496                    }
497          }          }
498  }  }
499    
# Line 361  __END__ Line 506  __END__
506    
507  =head1 NAME  =head1 NAME
508    
509  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
510    
511  =head1 DESCRIPTION  =head1 DESCRIPTION
512    
513  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
514  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
515  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
516  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
517  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
518    
519    =head1 BUGS
520    
521    Documentation is really lacking. However, in true Open Source spirit, source
522    is best documentation. I even made considerable effort to comment parts
523    which are not intuitively clear, so...
524    
525  =head1 AUTHOR  =head1 AUTHOR
526    

Legend:
Removed from v.58  
changed lines
  Added in v.101

  ViewVC Help
Powered by ViewVC 1.1.26