/[webpac]/trunk/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /trunk/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 4 by dpavlin, Sun Dec 1 22:51:29 2002 UTC revision 98 by dpavlin, Sun Jul 13 22:29:14 2003 UTC
# Line 5  use OpenIsis; Line 5  use OpenIsis;
5  use Getopt::Std;  use Getopt::Std;
6  use Data::Dumper;  use Data::Dumper;
7  use XML::Simple;  use XML::Simple;
8  use Text::Unaccent;  use Text::Unaccent 1.02;        # 1.01 won't compile on my platform,
9  require Unicode::Map8;  use Text::Iconv;
10    use Config::IniFiles;
11  my $config=XMLin(undef, forcearray => [ 'isis' ], forcecontent => 1);  use Encode;
12    
13    $|=1;
14    
15    my $config_file = $0;
16    $config_file =~ s/\.pl$/.conf/;
17    die "FATAL: can't find configuration file '$config_file'" if (! -e $config_file);
18    
19    my $config;
20    
21    #use index_DBI;         # default DBI module for index
22    use index_DBI_cache;    # faster DBI module using memory cache
23    my $index;
24    
25  my %opts;  my %opts;
26    
27  getopts('d:m:q', \%opts);  # usage:
28    #       -d directory name
29    #       -m multiple directories
30    #       -q quiet
31    #       -s run swish
32    
33    getopts('d:m:qs', \%opts);
34    
35    my $path;       # this is name of database
36    
37    Text::Iconv->raise_error(0);     # Conversion errors don't raise exceptions
38    
39    # this is encoding of all files on disk, including import_xml/*.xml file and
40    # filter/*.pm files! It will be used to store strings in perl internally!
41    my $codepage = 'ISO-8859-2';
42    
43    my $utf2cp = Text::Iconv->new('UTF-8',$codepage);
44    # this function will convert data from XML files to local encoding
45    sub x {
46            return $utf2cp->convert($_[0]);
47    }
48    
49  my $db_dir = $opts{d} || "ps";  # FIX  # decode isis/excel or other import codepage
50    my $import2cp;
51    
52  #die "usage: $0 -d [database_dir] -m [database1,database2] " if (! %opts);  # outgoing xml must be in UTF-8
53    my $cp2utf = Text::Iconv->new($codepage,'UTF-8');
54    
55  #print Dumper($config->{indexer});  # mapping between data type and tag which specify
56  #print "-" x 70,"\n";  # format in XML file
57    my %type2tag = (
58            'isis' => 'isis',
59            'excel' => 'column',
60            'marc' => 'marc',
61            'feed' => 'feed'
62    );
63    
64  # how to convert isis code page to UTF8?  sub data2xml {
 my $isis_map = Unicode::Map8->new($config->{isis_codepage}) || die;  
65    
66  sub isis2xml {          use xmlify;
67    
68            my $type = shift @_;
69          my $row = shift @_;          my $row = shift @_;
70            my $add_xml = shift @_;
71            # needed to read values from configuration file
72            my $cfg = shift @_;
73            my $database = shift @_;
74    
75          my $xml;          my $xml;
76    
77          sub isis_sf {          use parse_format;
78                  my $row = shift @_;  
79                  my $isis_id = shift @_;          my $html = "";          # html formatted display output
80                  my $subfield = shift @_;  
81                  if ($row->{$isis_id}->[0]) {          my %field_usage;        # counter for usage of each field
82                          my $sf = OpenIsis::subfields($row->{$isis_id}->[0]);  
83                          if (! defined $subfield || length($subfield) == 0) {          # sort subrouting using order="" attribute
84                                  # subfield list undef, empty or no defined subfields for this record          sub by_order {
85                                  my $all_sf = $row->{$isis_id}->[0];                  my $va = $config->{indexer}->{$a}->{order} ||
86                                  $all_sf =~ s/\^./ /g;   nuke definirions                          $config->{indexer}->{$a};
87                                  return $all_sf;                  my $vb = $config->{indexer}->{$b}->{order} ||
88                          } elsif ($sf->{$subfield}) {                          $config->{indexer}->{$b};
89                                  return $sf->{$subfield};  
90                          }                  return $va <=> $vb;
                 }  
91          }          }
92    
93          foreach my $field (keys %{$config->{indexer}}) {          foreach my $field (sort by_order keys %{$config->{indexer}}) {
94    
95                    $field=x($field);
96                    $field_usage{$field}++;
97    
98                    my $swish_data = "";
99                  my $display_data = "";                  my $display_data = "";
100                  my $index_data = "";                  my $line_delimiter;
101    
102                    my ($swish,$display);
103    
104                    my $tag = $type2tag{$type} || die "can't find which tag to use for type $type";
105                    foreach my $x (@{$config->{indexer}->{$field}->{$tag}}) {
106    
107                            my $format = x($x->{content});
108                            my $delimiter = x($x->{delimiter}) || ' ';
109    
110                  foreach my $x (@{$config->{indexer}->{$field}->{isis}}) {                          my $repeat_off = 0;             # repeatable offset
111    
112                          my $display_tmp = "";                          my ($s,$d,$i) = (1,1,0);        # swish, display default
113                          my $index_tmp = "";                          $s = 0 if (lc($x->{type}) eq "display");
114                            $d = 0 if (lc($x->{type}) eq "swish");
115                            ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
116    
117                          my $format = $x->{content};                          # what will separate last line from this one?
118                          my $i = 1;      # index only                          if ($display_data && $x->{append} && $x->{append} eq "1") {
119                          my $d = 1;      # display only                                  $line_delimiter = ' ';
120                          $i = 0 if (lc($x->{type}) eq "display");                          } elsif ($display_data) {
121                          $d = 0 if (lc($x->{type}) eq "index");                                  $line_delimiter = '<br/>';
122  #print "## i: $i d: $d ## $format ##";                            }
123                          # parse format  
124                          my $prefix = "";                          # init vars so that we go into while...
125                          if ($format =~ s/^([^\d]+)//) {                          ($swish,$display) = (1,1);
126                                  $prefix = $1;  
127                          }                          # placeholder for all repeatable entries for index
128                          while ($format) {                          my @index_data;
129                                  if ($format =~ s/^(\d\d\d)(\w?)//) {                          my $index_filter;
130                                          my $isis_tmp = isis_sf($row,$1,$2);  
131                                          if ($isis_tmp) {                          # while because of repeatable fields
132  #                                               $display_tmp .= $prefix . "/$1/$2/".$isis_tmp if ($d);                          while ($swish || $display) {
133                                                  $display_tmp .= $prefix . $isis_tmp if ($d);                                  ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                                  $index_tmp .= $isis_tmp." " if ($i);                                  if ($repeat_off > 1000) {
135  #print " $isis_tmp <--\n";                                          print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                    # filter="name" ; filter this field through
140                                    # filter/[name].pm
141                                    my $filter = $x->{filter};
142                                    if ($filter) {
143                                            require "filter/".$filter.".pm";
144                                    }
145                                    # type="swish" ; field for swish
146                                    if ($s && $swish) {
147                                            if ($filter) {
148                                                    no strict 'refs';
149                                                    $swish_data .= join(" ",&$filter($swish));
150                                            } else {
151                                                    $swish_data .= $swish;
152                                            }
153                                    }
154    
155                                    # type="display" ; field for display
156                                    if ($d && $display) {
157                                            if ($line_delimiter && $display_data) {
158                                                    $display_data .= $line_delimiter;
159                                                    undef $line_delimiter;
160                                            }
161                                            if ($filter) {
162                                                    no strict 'refs';
163                                                    $display_data .= join($delimiter,&$filter($display));
164                                            } else {
165                                                    if ($display_data) {
166                                                            $display_data .= $delimiter.$display;
167                                                    } else {
168                                                            $display_data .= $display;
169                                                    }
170                                            }
171                                    }
172                                                    
173                                    # type="index" ; insert into index
174                                    if ($i && $display) {
175                                            push @index_data, $display;
176                                            $index_filter = $filter if ($filter);
177                                    }
178                            }
179    
180                            # fill data in index
181                            if (@index_data) {
182                                    if ($index_filter) {
183                                            no strict 'refs';
184                                            foreach my $d (&$index_filter(@index_data)) {
185                                                    $index->insert($field, $d, $path);
186                                          }                                          }
                                         $prefix = "";  
                                 } elsif ($format =~ s/^([^\d]+)//) {  
                                         $prefix = $1;  
187                                  } else {                                  } else {
188                                          print STDERR "WARNING: unparsed format '$format'\n";                                          foreach my $d (@index_data) {
189                                          last;                                                  $index->insert($field, $d, $path);
190                                  };                                          }
191                                    }
192                          }                          }
193                          # add suffix                  }
194                          $display_tmp .= $prefix if ($display_tmp);  
195                    # now try to parse variables from configuration file
196                    foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {
197    
198                            my $delimiter = x($x->{delimiter}) || ' ';
199                            my $val = $cfg->val($database, x($x->{content}));
200    
201  #                       $display_data .= $display_tmp if ($display_tmp ne "");                          my ($s,$d,$i) = (1,1,0);        # swish, display default
202  #                       $index_data .= $index_tmp if ($index_tmp ne "");                          $s = 0 if (lc($x->{type}) eq "display");
203                          $display_data .= $display_tmp;                          $d = 0 if (lc($x->{type}) eq "swish");
204                          $index_data .= $index_tmp;                          ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
205    
206                            if ($val) {
207                                    $display_data .= $delimiter.$val if ($d);
208                                    $swish_data .= $val if ($s);
209                                    $index->insert($field, $val, $path) if ($i);
210                            }
211    
212                  }                  }
213  #print "--display:$display_data\n--index:$index_data\n";  
214                  $xml->{$field}->{display} .= $isis_map->tou($display_data)->utf8 if ($display_data);  
215                  $xml->{$field}->{index} .= unac_string($config->{isis_codepage},$index_data) if ($index_data);                  if ($display_data) {
216            
217                            if ($field eq "headline") {
218                                    $xml .= xmlify("headline", $display_data);
219                            } else {
220    
221                                    # find field name (signular, plural)
222                                    my $field_name = "";
223                                    if ($config->{indexer}->{$field}->{name_singular} && $field_usage{$field} == 1) {
224                                            $field_name = $config->{indexer}->{$field}->{name_singular}."#-#";
225                                    } elsif ($config->{indexer}->{$field}->{name_plural}) {
226                                            $field_name = $config->{indexer}->{$field}->{name_plural}."#-#";
227                                    } elsif ($config->{indexer}->{$field}->{name}) {
228                                            $field_name = $config->{indexer}->{$field}->{name}."#-#";
229                                    } else {
230                                            print STDERR "WARNING: field '$field' doesn't have 'name' attribute!";
231                                    }
232                                    if ($field_name) {
233                                            $html .= x($field_name);
234                                    }
235                                    $html .= $display_data."###\n";
236                            }
237                    }
238                    if ($swish_data) {
239                            # remove extra spaces
240                            $swish_data =~ s/ +/ /g;
241                            $swish_data =~ s/ +$//g;
242    
243                            $xml .= xmlify($field."_swish", unac_string($codepage,$swish_data));
244                    }
245    
246    
247          }          }
248    
249            # dump formatted output in <html>
250            if ($html) {
251                    #$xml .= xmlify("html",$html);
252                    $xml .= "<html><![CDATA[ $html ]]></html>";
253            }
254            
255          if ($xml) {          if ($xml) {
256                  return XMLout($xml, rootname => 'xml', noattr => 1 );                  $xml .= $add_xml if ($add_xml);
257                    return "<xml>\n$xml</xml>\n";
258          } else {          } else {
259                  return;                  return;
260          }          }
# Line 108  sub isis2xml { Line 262  sub isis2xml {
262    
263  ##########################################################################  ##########################################################################
264    
265  my $last_tell=0;  # read configuration for this script
266    my $cfg = new Config::IniFiles( -file => $config_file );
267    
268  my @isis_dirs = ( '.' );        # use dirname as database name  # read global.conf configuration
269    my $cfg_global = new Config::IniFiles( -file => 'global.conf' );
270    
271  if ($opts{m}) {  # open index
272          @isis_dirs = split(/,/,$opts{m});  $index = new index_DBI(
273  }                  $cfg_global->val('global', 'dbi_dbd'),
274                    $cfg_global->val('global', 'dbi_dsn'),
275                    $cfg_global->val('global', 'dbi_user'),
276                    $cfg_global->val('global', 'dbi_passwd') || '',
277            );
278    
279  my @isis_dbs;  my $show_progress = $cfg_global->val('global', 'show_progress');
280    
281  foreach (@isis_dirs) {  foreach my $database ($cfg->Sections) {
282          if (-e $config->{isis_data}."/$db_dir/$_/LIBRI") {  
283                  push @isis_dbs,$config->{isis_data}."/$db_dir/$_/LIBRI/LIBRI";          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
284          }          my $add_xml = $cfg -> val($database, 'xml');    # optional
285          if (-e $config->{isis_data}."/$db_dir/$_/PERI") {  
286                  push @isis_dbs,$config->{isis_data}."/$db_dir/$_/PERI/PERI";  print STDERR "reading ./import_xml/$type.xml\n";
287          }  
288          if (-e $config->{isis_data}."/$db_dir/$_/AMS") {          # extract just type basic
289                  push @isis_dbs,$config->{isis_data}."/$db_dir/$_/AMS/AMS";          my $type_base = $type;
290            $type_base =~ s/_.+$//g;
291    
292            $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type_base}, 'config' ], forcecontent => 1);
293    
294            # output current progress indicator
295            my $last_p = 0;
296            sub progress {
297                    # XXX return if ($show_progress ne "");
298                    my $current = shift;
299                    my $total = shift || 1;
300                    my $p = int($current * 100 / $total);
301                    if ($p != $last_p) {
302                            printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$current,$total,"=" x ($p/2).">", $p );
303                            $last_p = $p;
304                    }
305          }          }
306          if (-e $config->{isis_data}."/$db_dir/$_/ARTI") {  
307  #               push @isis_dbs,$config->{isis_data}."/$db_dir/$_/ARTI/ARTI";          my $fake_dir = 1;
308            sub fakeprogress {
309                    my $current = shift @_;
310    
311                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
312    
313                    $last_p += $fake_dir;
314                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
315                    if ($last_p % 10 == 0) {
316                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
317                    }
318          }          }
 }  
319    
320  print STDERR "FATAL: Can't find isis database.\nPerhaps isis_data (".$config->{isis_data}.") has wrong value?\n" if (! @isis_dbs);          # now read database
321    print STDERR "using: $type...\n";
322    
323  my $db;          if ($type_base eq "isis") {
324    
325  foreach my $isis_db (@isis_dbs) {                  my $isis_db = $cfg -> val($database, 'isis_db') || die "$database doesn't have 'isis_db' defined!";
326    
327                    $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);
328                    my $db = OpenIsis::open( $isis_db );
329    
330          my $db = OpenIsis::open( $isis_db );                  my $max_rowid = OpenIsis::maxRowid( $db );
         if (0) {  
 #       # FIX  
 #       if (! $db ) {  
                 print STDERR "WARNING: can't open '$isis_db'\n";  
                 next ;  
         }  
331    
332          my $max_rowid = OpenIsis::maxRowid( $db );                  print STDERR "Reading database: $isis_db [$max_rowid rows]\n";
333    
334          print STDERR "Reading database: $isis_db [$max_rowid rows]\n";                  my $path = $database;
335    
336          my $last_p = 0;                  for (my $row_id = 1; $row_id <= $max_rowid; $row_id++ ) {
337                            my $row = OpenIsis::read( $db, $row_id );
338                            if ($row && $row->{mfn}) {
339            
340                                    progress($row->{mfn}, $max_rowid);
341    
342                                    my $swishpath = $path."#".int($row->{mfn});
343    
344  #       { my $row_id = 1;                                  if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
345  # FIX                                          $xml = $cp2utf->convert($xml);
346          for (my $row_id = 1; $row_id <= $max_rowid; $row_id++ ) {                                          use bytes;      # as opposed to chars
347                  my $row = OpenIsis::read( $db, $row_id );                                          print "Path-Name: $swishpath\n";
348                  if ($row && $row->{mfn}) {                                          print "Content-Length: ".(length($xml)+1)."\n";
349                                            print "Document-Type: XML\n\n$xml\n";
350                          # output current process indicator                                  }
351                          my $p = int($row->{mfn} * 100 / $max_rowid);                          }
352                          if ($p != $last_p) {                  }
353                                  printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$row->{mfn},$max_rowid,"=" x ($p/2).">", $p ) if (! $opts{q});                  print STDERR "\n";
354                                  $last_p = $p;  
355            } elsif ($type_base eq "excel") {
356                    use Spreadsheet::ParseExcel;
357                    use Spreadsheet::ParseExcel::Utility qw(int2col);
358                    
359                    $import2cp = Text::Iconv->new($config->{excel_codepage},$codepage);
360                    my $excel_file = $cfg -> val($database, 'excel_file') || die "$database doesn't have 'excel_file' defined!";
361    
362                    my $sheet = x($config->{sheet}) || die "no sheet in $type.xml";
363                    my $start_row = x($config->{start_row}) - 1 || die "no start_row in $type.xml";
364    
365                    my $oBook = Spreadsheet::ParseExcel::Workbook->Parse($excel_file) || die "can't open Excel file '$excel_file'";
366    
367                    my $sheet_nr = 0;
368                    foreach my $oWks (@{$oBook->{Worksheet}}) {
369                            #print STDERR "-- SHEET $sheet_nr:", $oWks->{Name}, "\n";
370                            last if ($oWks->{Name} eq $sheet);
371                            $sheet_nr++;
372                    }
373    
374                    my $oWorksheet = $oBook->{Worksheet}[$sheet_nr];
375            
376                    print STDERR "using sheet: ",$oWorksheet->{Name},"\n";
377                    defined ($oWorksheet) || die "can't find sheet '$sheet' in $excel_file";
378                    my $end_row = x($config->{end_row}) || $oWorksheet->{MaxRow};
379    
380                    for(my $iR = $start_row ; defined $end_row && $iR <= $end_row ; $iR++) {
381                            my $row;
382                            for(my $iC = $oWorksheet->{MinCol} ; defined $oWorksheet->{MaxCol} && $iC <= $oWorksheet->{MaxCol} ; $iC++) {
383                                    my $cell = $oWorksheet->{Cells}[$iR][$iC];
384                                    if ($cell) {
385                                            $row->{int2col($iC)} = $cell->Value;
386                                    }
387                            }
388    
389                            progress($iR, $end_row);
390    
391    #                       print "row[$iR/$end_row] ";
392    #                       foreach (keys %{$row}) {
393    #                               print "$_: ",$row->{$_},"\t";
394    #                       }
395    #                       print "\n";
396    
397                            my $swishpath = $database."#".$iR;
398    
399                            next if (! $row);
400    
401                            if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
402                                    $xml = $cp2utf->convert($xml);
403                                    use bytes;      # as opposed to chars
404                                    print "Path-Name: $swishpath\n";
405                                    print "Content-Length: ".(length($xml)+1)."\n";
406                                    print "Document-Type: XML\n\n$xml\n";
407                          }                          }
408                    }
409            } elsif ($type_base eq "marc") {
410    
411                    use MARC;
412                    
413                    $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
414                    my $marc_file = $cfg -> val($database, 'marc_file') || die "$database doesn't have 'marc_file' defined!";
415    
416                    # optional argument is format
417                    my $format = x($config->{format}) || 'usmarc';
418    
419                    print STDERR "Reading MARC file '$marc_file'\n";
420    
421                    my $marc = new MARC;
422                    my $nr = $marc->openmarc({
423                                    file=>$marc_file, format=>$format
424                            }) || die "Can't open MARC file '$marc_file'";
425    
426                    my $i=0;        # record nr.
427    
428                          if (my $xml = isis2xml($row)) {                  my $rec;
429                                  print "Path-Name: $isis_db#".$row->{mfn}."\n";  
430                    while ($marc->nextmarc(1)) {
431    
432                            # XXX
433                            fakeprogress($i++);
434    
435                            my $swishpath = $database."#".$i;
436    
437                            if (my $xml = data2xml($type_base,$marc,$add_xml,$cfg,$database)) {
438                                    $xml = $cp2utf->convert($xml);
439                                    use bytes;      # as opposed to chars
440                                    print "Path-Name: $swishpath\n";
441                                  print "Content-Length: ".(length($xml)+1)."\n";                                  print "Content-Length: ".(length($xml)+1)."\n";
442                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
443                          }                          }
444                  }                  }
445            } elsif ($type_base eq "feed") {
446    
447                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
448                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
449    
450                    print STDERR "Reading feed from program '$prog'\n";
451    
452                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
453    
454                    my $i=1;        # record nr.
455    
456                    my $data;
457                    my $line=1;
458    
459                    while (<FEED>) {
460                            chomp;
461    
462                            if (/^$/) {
463                                    my $swishpath = $database."#".$i++;
464    
465                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
466                                            $xml = $cp2utf->convert($xml);
467                                            use bytes;      # as opposed to chars
468                                            print "Path-Name: $swishpath\n";
469                                            print "Content-Length: ".(length($xml)+1)."\n";
470                                            print "Document-Type: XML\n\n$xml\n";
471                                    }
472                                    $line = 1;
473                                    $data = {};
474                                    next;
475                            }
476    
477                            $line = $1 if (s/^(\d+):\s*//);
478                            $data->{$line++} = $_;
479    
480                            fakeprogress($i);
481    
482                    }
483          }          }
         print STDERR "\n";  
484  }  }
485    
486    # call this to commit index
487    $index->close;
488    
489  1;  1;
490  __END__  __END__
# Line 184  __END__ Line 492  __END__
492    
493  =head1 NAME  =head1 NAME
494    
495  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
496    
497  =head1 DESCRIPTION  =head1 DESCRIPTION
498    
499  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
500  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
501  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
502  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
503  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
504    
505    =head1 BUGS
506    
507    Documentation is really lacking. However, in true Open Source spirit, source
508    is best documentation. I even made considerable effort to comment parts
509    which are not intuitively clear, so...
510    
511  =head1 AUTHOR  =head1 AUTHOR
512    

Legend:
Removed from v.4  
changed lines
  Added in v.98

  ViewVC Help
Powered by ViewVC 1.1.26