/[webpac]/trunk/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /trunk/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 59 by dpavlin, Fri Jul 4 17:57:11 2003 UTC revision 97 by dpavlin, Sun Jul 13 21:57:12 2003 UTC
# Line 56  my $cp2utf = Text::Iconv->new($codepage, Line 56  my $cp2utf = Text::Iconv->new($codepage,
56  # format in XML file  # format in XML file
57  my %type2tag = (  my %type2tag = (
58          'isis' => 'isis',          'isis' => 'isis',
59          'excel' => 'column'          'excel' => 'column',
60            'marc' => 'marc',
61            'feed' => 'feed'
62  );  );
63    
64  sub data2xml {  sub data2xml {
# Line 122  sub data2xml { Line 124  sub data2xml {
124                          # init vars so that we go into while...                          # init vars so that we go into while...
125                          ($swish,$display) = (1,1);                          ($swish,$display) = (1,1);
126    
127                          if ($swish || $display) {                          # placeholder for all repeatable entries for index
128                            my @index_data;
129                            my $index_filter;
130    
131                            # while because of repeatable fields
132                            while ($swish || $display) {
133                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                    if ($repeat_off > 1000) {
135                                            print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                  # filter="name" ; filter this field through                                  # filter="name" ; filter this field through
140                                  # filter/[name].pm                                  # filter/[name].pm
141                                  my $filter = $x->{filter};                                  my $filter = $x->{filter};
# Line 160  sub data2xml { Line 172  sub data2xml {
172                                                                                                    
173                                  # type="index" ; insert into index                                  # type="index" ; insert into index
174                                  if ($i && $display) {                                  if ($i && $display) {
175                                          my $index_data = $display;                                          push @index_data, $display;
176                                          if ($filter) {                                          $index_filter = $filter if ($filter);
177                                                  no strict 'refs';                                  }
178                                                  foreach my $d (&$filter($index_data)) {                          }
179                                                          $index->insert($field, $d, $path);  
180                                                  }                          # fill data in index
181                                          } else {                          if (@index_data) {
182                                                  $index->insert($field, $index_data, $path);                                  if ($index_filter) {
183                                            no strict 'refs';
184                                            foreach my $d (&$index_filter(@index_data)) {
185                                                    $index->insert($field, $d, $path);
186                                            }
187                                    } else {
188                                            foreach my $d (@index_data) {
189                                                    $index->insert($field, $d, $path);
190                                          }                                          }
191                                  }                                  }
192                          }                          }
# Line 176  sub data2xml { Line 195  sub data2xml {
195                  # now try to parse variables from configuration file                  # now try to parse variables from configuration file
196                  foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {                  foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {
197    
198                            my $delimiter = x($x->{delimiter}) || ' ';
199                          my $val = $cfg->val($database, x($x->{content}));                          my $val = $cfg->val($database, x($x->{content}));
200    
201                          my ($s,$d,$i) = (1,1,0);        # swish, display default                          my ($s,$d,$i) = (1,1,0);        # swish, display default
# Line 184  sub data2xml { Line 204  sub data2xml {
204                          ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");                          ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
205    
206                          if ($val) {                          if ($val) {
207                                  $display_data .= $val if ($d);                                  $display_data .= $delimiter.$val if ($d);
208                                  $swish_data .= $val if ($s);                                  $swish_data .= $val if ($s);
209                                  $index->insert($field, $val, $path) if ($i);                                  $index->insert($field, $val, $path) if ($i);
210                          }                          }
# Line 228  sub data2xml { Line 248  sub data2xml {
248    
249          # dump formatted output in <html>          # dump formatted output in <html>
250          if ($html) {          if ($html) {
251                  $xml .= xmlify("html",$html);                  #$xml .= xmlify("html",$html);
252                    $xml .= "<html><![CDATA[ $html ]]></html>";
253          }          }
254                    
255          if ($xml) {          if ($xml) {
# Line 255  $index = new index_DBI( Line 276  $index = new index_DBI(
276                  $cfg_global->val('global', 'dbi_passwd') || '',                  $cfg_global->val('global', 'dbi_passwd') || '',
277          );          );
278    
279    my $show_progress = $cfg_global->val('global', 'show_progress');
280    
281  foreach my $database ($cfg->Sections) {  foreach my $database ($cfg->Sections) {
282    
283          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
# Line 271  print STDERR "reading ./import_xml/$type Line 294  print STDERR "reading ./import_xml/$type
294          # output current progress indicator          # output current progress indicator
295          my $last_p = 0;          my $last_p = 0;
296          sub progress {          sub progress {
297                  #return if (! $opts{q});        # FIXME                  # XXX return if ($show_progress ne "");
298                  my $current = shift;                  my $current = shift;
299                  my $total = shift || 1;                  my $total = shift || 1;
300                  my $p = int($current * 100 / $total);                  my $p = int($current * 100 / $total);
# Line 281  print STDERR "reading ./import_xml/$type Line 304  print STDERR "reading ./import_xml/$type
304                  }                  }
305          }          }
306    
307            my $fake_dir = 1;
308            sub fakeprogress {
309                    my $current = shift @_;
310    
311                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
312    
313                    $last_p += $fake_dir;
314                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
315                    if ($last_p % 10 == 0) {
316                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
317                    }
318            }
319    
320          # now read database          # now read database
321  print STDERR "using: $type...\n";  print STDERR "using: $type...\n";
322    
# Line 370  print STDERR "using: $type...\n"; Line 406  print STDERR "using: $type...\n";
406                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
407                          }                          }
408                  }                  }
409            } elsif ($type_base eq "marc") {
410    
411                    use MARC;
412                    
413                    $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
414                    my $marc_file = $cfg -> val($database, 'marc_file') || die "$database doesn't have 'marc_file' defined!";
415    
416                    # optional argument is format
417                    my $format = x($config->{format}) || 'usmarc';
418    
419                    print STDERR "Reading MARC file '$marc_file'\n";
420    
421                    my $marc = new MARC;
422                    my $nr = $marc->openmarc({
423                                    file=>$marc_file, format=>$format
424                            }) || die "Can't open MARC file '$marc_file'";
425    
426                    my $i=0;        # record nr.
427    
428                    my $rec;
429    
430                    while ($marc->nextmarc(1)) {
431    
432                            # XXX
433                            fakeprogress($i++);
434    
435                            my $swishpath = $database."#".$i;
436    
437                            if (my $xml = data2xml($type_base,$marc,$add_xml,$cfg,$database)) {
438                                    $xml = $cp2utf->convert($xml);
439                                    use bytes;      # as opposed to chars
440                                    print "Path-Name: $swishpath\n";
441                                    print "Content-Length: ".(length($xml)+1)."\n";
442                                    print "Document-Type: XML\n\n$xml\n";
443                            }
444                    }
445            } elsif ($type_base eq "feed") {
446    
447                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
448                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
449    
450                    print STDERR "Reading feed from program '$prog'\n";
451    
452                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
453    
454                    my $i=1;        # record nr.
455    
456                    my $data;
457                    my $line=1;
458    
459                    while (<FEED>) {
460                            chomp;
461    
462                            if (/^$/) {
463                                    my $swishpath = $database."#".$i++;
464    
465                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
466                                            $xml = $cp2utf->convert($xml);
467                                            use bytes;      # as opposed to chars
468                                            print "Path-Name: $swishpath\n";
469                                            print "Content-Length: ".(length($xml)+1)."\n";
470                                            print "Document-Type: XML\n\n$xml\n";
471                                    }
472                                    $line = 1;
473                                    $data = {};
474                                    next;
475                            }
476    
477                            $line = $1 if (s/^(\d+):\s*//);
478                            $data->{$line++} = $_;
479    
480                            fakeprogress($i);
481    
482                    }
483          }          }
484  }  }
485    
# Line 382  __END__ Line 492  __END__
492    
493  =head1 NAME  =head1 NAME
494    
495  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
496    
497  =head1 DESCRIPTION  =head1 DESCRIPTION
498    
499  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
500  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
501  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
502  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
503  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
504    
505    =head1 BUGS
506    
507    Documentation is really lacking. However, in true Open Source spirit, source
508    is best documentation. I even made considerable effort to comment parts
509    which are not intuitively clear, so...
510    
511  =head1 AUTHOR  =head1 AUTHOR
512    

Legend:
Removed from v.59  
changed lines
  Added in v.97

  ViewVC Help
Powered by ViewVC 1.1.26