/[webpac]/trunk/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /trunk/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 62 by dpavlin, Fri Jul 4 20:11:48 2003 UTC revision 102 by dpavlin, Mon Jul 14 10:54:34 2003 UTC
# Line 58  my %type2tag = ( Line 58  my %type2tag = (
58          'isis' => 'isis',          'isis' => 'isis',
59          'excel' => 'column',          'excel' => 'column',
60          'marc' => 'marc',          'marc' => 'marc',
61            'feed' => 'feed'
62  );  );
63    
64  sub data2xml {  sub data2xml {
# Line 81  sub data2xml { Line 82  sub data2xml {
82    
83          # sort subrouting using order="" attribute          # sort subrouting using order="" attribute
84          sub by_order {          sub by_order {
85                  return 0 if (! $config->{indexer}->{$a}->{order});                  my $va = $config->{indexer}->{$a}->{order} ||
86                  return 0 if (! $config->{indexer}->{$b}->{order});                          $config->{indexer}->{$a};
87                    my $vb = $config->{indexer}->{$b}->{order} ||
88                            $config->{indexer}->{$b};
89    
90                  return $config->{indexer}->{$a}->{order} <=>                  return $va <=> $vb;
                         $config->{indexer}->{$b}->{order} ;  
91          }          }
92    
93          foreach my $field (sort by_order keys %{$config->{indexer}}) {          foreach my $field (sort by_order keys %{$config->{indexer}}) {
94    
95                  $field=x($field);                  $field=x($field);
   
96                  $field_usage{$field}++;                  $field_usage{$field}++;
97    
98                  my $swish_data = "";                  my $swish_data = "";
# Line 123  sub data2xml { Line 124  sub data2xml {
124                          # init vars so that we go into while...                          # init vars so that we go into while...
125                          ($swish,$display) = (1,1);                          ($swish,$display) = (1,1);
126    
127                          if ($swish || $display) {                          # placeholder for all repeatable entries for index
128                            my @index_data;
129                            my $index_filter;
130    
131                            # while because of repeatable fields
132                            while ($swish || $display) {
133                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                    if ($repeat_off > 1000) {
135                                            print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                  # filter="name" ; filter this field through                                  # filter="name" ; filter this field through
140                                  # filter/[name].pm                                  # filter/[name].pm
141                                  my $filter = $x->{filter};                                  my $filter = $x->{filter};
# Line 161  sub data2xml { Line 172  sub data2xml {
172                                                                                                    
173                                  # type="index" ; insert into index                                  # type="index" ; insert into index
174                                  if ($i && $display) {                                  if ($i && $display) {
175                                          my $index_data = $display;                                          push @index_data, $display;
176                                          if ($filter) {                                          $index_filter = $filter if ($filter);
177                                                  no strict 'refs';                                  }
178                                                  foreach my $d (&$filter($index_data)) {                          }
179                                                          $index->insert($field, $d, $path);  
180                                                  }                          # fill data in index
181                                          } else {                          if (@index_data) {
182                                                  $index->insert($field, $index_data, $path);                                  if ($index_filter) {
183                                            no strict 'refs';
184                                            foreach my $d (&$index_filter(@index_data)) {
185                                                    $index->insert($field, $d, $path);
186                                            }
187                                    } else {
188                                            foreach my $d (@index_data) {
189                                                    $index->insert($field, $d, $path);
190                                          }                                          }
191                                  }                                  }
192                          }                          }
# Line 230  sub data2xml { Line 248  sub data2xml {
248    
249          # dump formatted output in <html>          # dump formatted output in <html>
250          if ($html) {          if ($html) {
251                  $xml .= xmlify("html",$html);                  #$xml .= xmlify("html",$html);
252                    $xml .= "<html><![CDATA[ $html ]]></html>";
253          }          }
254                    
255          if ($xml) {          if ($xml) {
# Line 257  $index = new index_DBI( Line 276  $index = new index_DBI(
276                  $cfg_global->val('global', 'dbi_passwd') || '',                  $cfg_global->val('global', 'dbi_passwd') || '',
277          );          );
278    
279    my $show_progress = $cfg_global->val('global', 'show_progress');
280    
281  foreach my $database ($cfg->Sections) {  foreach my $database ($cfg->Sections) {
282    
283          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
# Line 273  print STDERR "reading ./import_xml/$type Line 294  print STDERR "reading ./import_xml/$type
294          # output current progress indicator          # output current progress indicator
295          my $last_p = 0;          my $last_p = 0;
296          sub progress {          sub progress {
297                  #return if (! $opts{q});        # FIXME                  return if (! $show_progress);
298                  my $current = shift;                  my $current = shift;
299                  my $total = shift || 1;                  my $total = shift || 1;
300                  my $p = int($current * 100 / $total);                  my $p = int($current * 100 / $total);
# Line 283  print STDERR "reading ./import_xml/$type Line 304  print STDERR "reading ./import_xml/$type
304                  }                  }
305          }          }
306    
307            my $fake_dir = 1;
308            sub fakeprogress {
309                    my $current = shift @_;
310    
311                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
312    
313                    $last_p += $fake_dir;
314                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
315                    if ($last_p % 10 == 0) {
316                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
317                    }
318            }
319    
320          # now read database          # now read database
321  print STDERR "using: $type...\n";  print STDERR "using: $type...\n";
322    
# Line 293  print STDERR "using: $type...\n"; Line 327  print STDERR "using: $type...\n";
327                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);                  $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);
328                  my $db = OpenIsis::open( $isis_db );                  my $db = OpenIsis::open( $isis_db );
329    
330                    # OpenIsis::ERR_BADF
331                    if ($db == -4) {
332                            print STDERR "FATAL: OpenIsis can't find file $isis_db\n";
333                            next;
334                    # OpenIsis::ERR_IO
335                    } elsif ($db == -5) {
336                            print STDERR "FATAL: OpenIsis can't access file $isis_db\n";
337                            next;
338                    } elsif ($db < 0) {
339                            print STDERR "FATAL: OpenIsis unknown error $db with file $isis_db\n";
340                            next;
341                    }
342    
343                  my $max_rowid = OpenIsis::maxRowid( $db );                  my $max_rowid = OpenIsis::maxRowid( $db );
344    
345                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";
# Line 373  print STDERR "using: $type...\n"; Line 420  print STDERR "using: $type...\n";
420                          }                          }
421                  }                  }
422          } elsif ($type_base eq "marc") {          } elsif ($type_base eq "marc") {
423          ## XXX  
424                  use MARC;                  use MARC;
425                                    
426                  $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);                  $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
# Line 382  print STDERR "using: $type...\n"; Line 429  print STDERR "using: $type...\n";
429                  # optional argument is format                  # optional argument is format
430                  my $format = x($config->{format}) || 'usmarc';                  my $format = x($config->{format}) || 'usmarc';
431    
                 my %id_stored;  # to aviod duplicates  
   
432                  print STDERR "Reading MARC file '$marc_file'\n";                  print STDERR "Reading MARC file '$marc_file'\n";
433    
434                  my $marc = new MARC;                  my $marc = new MARC;
# Line 392  print STDERR "using: $type...\n"; Line 437  print STDERR "using: $type...\n";
437                          }) || die "Can't open MARC file '$marc_file'";                          }) || die "Can't open MARC file '$marc_file'";
438    
439                  my $i=0;        # record nr.                  my $i=0;        # record nr.
                 my $inc=1;  
                 my $max_i=1000;  
440    
441                  my $rec;                  my $rec;
442    
443                  while ($marc->nextmarc(1)) {                  while ($marc->nextmarc(1)) {
444    
445                          # XXX                          # XXX
446                          progress($i, $max_i);                          fakeprogress($i++);
                         $i += $inc;  
                         $inc = -$inc if ($i > $max_i || $i < 0);  
447    
448                          my $swishpath = $database."#".$i;                          my $swishpath = $database."#".$i;
449    
# Line 414  print STDERR "using: $type...\n"; Line 455  print STDERR "using: $type...\n";
455                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
456                          }                          }
457                  }                  }
458            } elsif ($type_base eq "feed") {
459    
460                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
461                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
462    
463                    print STDERR "Reading feed from program '$prog'\n";
464    
465                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
466    
467                    my $i=1;        # record nr.
468    
469                    my $data;
470                    my $line=1;
471    
472                    while (<FEED>) {
473                            chomp;
474    
475                            if (/^$/) {
476                                    my $swishpath = $database."#".$i++;
477    
478                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
479                                            $xml = $cp2utf->convert($xml);
480                                            use bytes;      # as opposed to chars
481                                            print "Path-Name: $swishpath\n";
482                                            print "Content-Length: ".(length($xml)+1)."\n";
483                                            print "Document-Type: XML\n\n$xml\n";
484                                    }
485                                    $line = 1;
486                                    $data = {};
487                                    next;
488                            }
489    
490                            $line = $1 if (s/^(\d+):\s*//);
491                            $data->{$line++} = $_;
492    
493                            fakeprogress($i);
494    
495                    }
496          }          }
497  }  }
498    
# Line 426  __END__ Line 505  __END__
505    
506  =head1 NAME  =head1 NAME
507    
508  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
509    
510  =head1 DESCRIPTION  =head1 DESCRIPTION
511    
512  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
513  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
514  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
515  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
516  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
517    
518    =head1 BUGS
519    
520    Documentation is really lacking. However, in true Open Source spirit, source
521    is best documentation. I even made considerable effort to comment parts
522    which are not intuitively clear, so...
523    
524  =head1 AUTHOR  =head1 AUTHOR
525    

Legend:
Removed from v.62  
changed lines
  Added in v.102

  ViewVC Help
Powered by ViewVC 1.1.26