/[webpac]/branches/ffzg/all2xml.pl
This is repository of my old source code which isn't updated any more. Go to git.rot13.org for current projects!
ViewVC logotype

Diff of /branches/ffzg/all2xml.pl

Parent Directory Parent Directory | Revision Log Revision Log | View Patch Patch

revision 32 by dpavlin, Sun Feb 23 07:53:01 2003 UTC revision 135 by dpavlin, Wed Oct 29 21:27:00 2003 UTC
# Line 8  use XML::Simple; Line 8  use XML::Simple;
8  use Text::Unaccent 1.02;        # 1.01 won't compile on my platform,  use Text::Unaccent 1.02;        # 1.01 won't compile on my platform,
9  use Text::Iconv;  use Text::Iconv;
10  use Config::IniFiles;  use Config::IniFiles;
11    use Encode;
12    
13  $|=1;  $|=1;
14    
# Line 17  die "FATAL: can't find configuration fil Line 18  die "FATAL: can't find configuration fil
18    
19  my $config;  my $config;
20    
21  use index_DBI;  # there is no other, right now ;-)  #use index_DBI;         # default DBI module for index
22    use index_DBI_cache;    # faster DBI module using memory cache
23  my $index = new index_DBI();    # open index  my $index;
24    
25  my %opts;  my %opts;
26    
# Line 31  my %opts; Line 32  my %opts;
32    
33  getopts('d:m:qs', \%opts);  getopts('d:m:qs', \%opts);
34    
35  my $db_dir;  my $path;       # this is name of database
   
 #die "usage: $0 -d [database_dir] -m [database1,database2] " if (! %opts);  
36    
37  #print Dumper($config->{indexer});  Text::Iconv->raise_error(0);     # Conversion errors don't raise exceptions
 #print "-" x 70,"\n";  
38    
39  Text::Iconv->raise_error(1);     # Conversion errors raise exceptions  # this is encoding of all files on disk, including import_xml/*.xml file and
40    # filter/*.pm files! It will be used to store strings in perl internally!
41    my $codepage = 'ISO-8859-2';
42    
43    my $utf2cp = Text::Iconv->new('UTF-8',$codepage);
44    # this function will convert data from XML files to local encoding
45    sub x {
46            return $utf2cp->convert($_[0]);
47    }
48    
49  my $isis_codepage;  # decode isis/excel or other import codepage
50  my $index_codepage;  my $import2cp;
 my $cludge_codepage = Text::Iconv->new('UTF8','ISO8859-1');  
 my $xml_codepage;  
51    
52  my $XML_CHARSET = 'UTF8';  # outgoing xml must be in UTF-8
53    my $cp2utf = Text::Iconv->new($codepage,'UTF-8');
54    
55    # mapping between data type and tag which specify
56    # format in XML file
57    my %type2tag = (
58            'isis' => 'isis',
59            'excel' => 'column',
60            'marc' => 'marc',
61            'feed' => 'feed'
62    );
63    
64  sub isis2xml {  sub data2xml {
65    
66          use xmlify;          use xmlify;
67    
68            my $type = shift @_;
69          my $row = shift @_;          my $row = shift @_;
70          my $add_xml = shift @_;          my $add_xml = shift @_;
71            # needed to read values from configuration file
72            my $cfg = shift @_;
73            my $database = shift @_;
74    
75          my $xml;          my $xml;
76    
# Line 65  sub isis2xml { Line 82  sub isis2xml {
82    
83          # sort subrouting using order="" attribute          # sort subrouting using order="" attribute
84          sub by_order {          sub by_order {
85                  return 0 if (! $config->{indexer}->{$a}->{order});                  my $va = $config->{indexer}->{$a}->{order} ||
86                  return 0 if (! $config->{indexer}->{$b}->{order});                          $config->{indexer}->{$a};
87                    my $vb = $config->{indexer}->{$b}->{order} ||
88                            $config->{indexer}->{$b};
89    
90                  return $config->{indexer}->{$a}->{order} <=>                  return $va <=> $vb;
                         $config->{indexer}->{$b}->{order} ;  
91          }          }
92    
93          foreach my $field (sort by_order keys %{$config->{indexer}}) {          foreach my $field (sort by_order keys %{$config->{indexer}}) {
94    
95                    $field=x($field);
96                  $field_usage{$field}++;                  $field_usage{$field}++;
97    
98                  my $swish_data = "";                  my $swish_data = "";
99                  my $display_data = "";                  my $display_data = "";
100                  my $line_delimiter = "";                  my $line_delimiter;
101    
102                  foreach my $x (@{$config->{indexer}->{$field}->{isis}}) {                  my ($swish,$display);
103    
104                          my $format = $x->{content};                  my $tag = $type2tag{$type} || die "can't find which tag to use for type $type";
105                          my $delimiter = $x->{delimiter} || ' ';                  foreach my $x (@{$config->{indexer}->{$field}->{$tag}}) {
106    
107                          # FIX: this is ugly, UGLY, cludge string is returned                          my $format = x($x->{content});
108                          # in UTF8 encoding , but as if source charset                          my $delimiter = x($x->{delimiter}) || ' ';
                         # is ISO8859-1 and not some other. This break other  
                         # character encodings, so we convert it first  
                         # back to ISO8859-1  
                         $format = $xml_codepage->convert($format);  
                         $delimiter = $xml_codepage->convert($delimiter) if ($delimiter);  
109    
110                          my $isis_i = 0;         # isis repeatable offset                          my $repeat_off = 0;             # repeatable offset
111    
112                          my ($s,$d,$i) = (1,1,0);        # swish, display default                          my ($s,$d,$i) = (1,1,0);        # swish, display default
113                          $s = 0 if (lc($x->{type}) eq "display");                          $s = 0 if (lc($x->{type}) eq "display");
114                          $d = 0 if (lc($x->{type}) eq "swish");                          $d = 0 if (lc($x->{type}) eq "swish");
115                          ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");                          ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
 #print STDERR "## s: $s d: $d i: $i ## $format ##\n";    
116    
117                          $display_data .= $line_delimiter if ($display_data && $display_data !~ /$line_delimiter$/);                          # what will separate last line from this one?
118                            if ($display_data && $x->{append} && $x->{append} eq "1") {
119                                    $line_delimiter = ' ';
120                            } elsif ($display_data) {
121                                    $line_delimiter = '<br/>';
122                            }
123    
124                          my ($swish,$display) = (1,1);                          # init vars so that we go into while...
125                            ($swish,$display) = (1,1);
126    
127                          while ($swish || $display) {                          # placeholder for all repeatable entries for index
128                                  ($swish,$display) = parse_format($format,$row,$isis_i++);                          my @index_data;
129  #print STDERR "s: $swish\nd: $display\n" if ($swish);                          my $index_filter;
   
 #print STDERR "swish: $swish<-- display: $display<--\n";  
130    
131                            # while because of repeatable fields
132                            while ($swish || $display) {
133                                    ($swish,$display) = parse_format($type, $format,$row,$repeat_off++,$import2cp);
134                                    if ($repeat_off > 1000) {
135                                            print STDERR "loop (more than 1000 repeatable fields) deteced in $row, $format\n";
136                                            last;
137                                    }
138                                    
139                                  # filter="name" ; filter this field through                                  # filter="name" ; filter this field through
140                                  # filter/[name].pm                                  # filter/[name].pm
141                                  my $filter = $x->{filter};                                  my $filter = $x->{filter};
# Line 120  sub isis2xml { Line 145  sub isis2xml {
145                                  # type="swish" ; field for swish                                  # type="swish" ; field for swish
146                                  if ($s && $swish) {                                  if ($s && $swish) {
147                                          if ($filter) {                                          if ($filter) {
 #print STDERR "using filter '$filter'\n";  
148                                                  no strict 'refs';                                                  no strict 'refs';
149                                                  $swish_data .= join(" ",&$filter($swish));                                                  $swish_data .= join(" ",&$filter($swish));
150                                          } else {                                          } else {
# Line 130  sub isis2xml { Line 154  sub isis2xml {
154    
155                                  # type="display" ; field for display                                  # type="display" ; field for display
156                                  if ($d && $display) {                                  if ($d && $display) {
157                                            if ($line_delimiter && $display_data) {
158                                                    $display_data .= $line_delimiter;
159                                                    undef $line_delimiter;
160                                            }
161                                          if ($filter) {                                          if ($filter) {
162                                                  no strict 'refs';                                                  no strict 'refs';
163                                                  $display_data .= join($delimiter,&$filter($display));                                                  $display_data .= join($delimiter,&$filter($display));
# Line 144  sub isis2xml { Line 172  sub isis2xml {
172                                                                                                    
173                                  # type="index" ; insert into index                                  # type="index" ; insert into index
174                                  if ($i && $display) {                                  if ($i && $display) {
175                                          my $index_data = $index_codepage->convert($display) || $display;                                          push @index_data, $display;
176                                          if ($filter) {                                          $index_filter = $filter if ($filter);
                                                 no strict 'refs';  
                                                 foreach my $d (&$filter($index_data)) {  
                                                         $index->insert($field, $d, $db_dir);  
                                                 }  
                                         } else {  
                                                 $index->insert($field, $index_data, $db_dir);  
                                         }  
177                                  }                                  }
178                          }                          }
179                          if ($x->{append}) {  
180                                  $line_delimiter = ' ';                          # fill data in index
181                          } else {                          if (@index_data) {
182                                  $line_delimiter = '<br/>';                                  if ($index_filter) {
183                                            no strict 'refs';
184                                            foreach my $d (@index_data) {
185                                                    $index->insert($field, &$index_filter($d), $path);
186                                            }
187                                    } else {
188                                            foreach my $d (@index_data) {
189                                                    $index->insert($field, $d, $path);
190                                            }
191                                    }
192                          }                          }
193                  }                  }
194    
195                    # now try to parse variables from configuration file
196                    foreach my $x (@{$config->{indexer}->{$field}->{'config'}}) {
197    
198  #print STDERR "s_d: $swish_data\nd_d: $display_data\n" if ($swish_data);                          my $delimiter = x($x->{delimiter}) || ' ';
199                  if ($display_data) {                          my $val = $cfg->val($database, x($x->{content}));
200    
201                          # remove last <br>                          my ($s,$d,$i) = (1,1,0);        # swish, display default
202                          $display_data =~ s/$line_delimiter$//;                          $s = 0 if (lc($x->{type}) eq "display");
203                            $d = 0 if (lc($x->{type}) eq "swish");
204                            ($s,$d,$i) = (0,0,1) if (lc($x->{type}) eq "index");
205    
206                            if ($val) {
207                                    $display_data .= $delimiter.$val if ($d);
208                                    $swish_data .= $val if ($s);
209                                    $index->insert($field, $val, $path) if ($i);
210                            }
211    
212                    }
213    
214                          $display_data = $isis_codepage->convert($display_data) || die "Can't convert '$display_data' !";  
215                          # FIX: this is removed and replaced by html tag.                  if ($display_data) {
                         #$xml .= xmlify($field."_display", $display_data);  
216    
217                          if ($field eq "headline") {                          if ($field eq "headline") {
218                                  $xml .= xmlify("headline", $display_data);                                  $xml .= xmlify("headline", $display_data);
# Line 189  sub isis2xml { Line 230  sub isis2xml {
230                                          print STDERR "WARNING: field '$field' doesn't have 'name' attribute!";                                          print STDERR "WARNING: field '$field' doesn't have 'name' attribute!";
231                                  }                                  }
232                                  if ($field_name) {                                  if ($field_name) {
233                                          $html .= $xml_codepage->convert($field_name);                                          $html .= x($field_name);
 #                                       $html .= "-->".$field_name."<--";  
234                                  }                                  }
235                                  $html .= $display_data."###\n";                                  $html .= $display_data."###\n";
236                          }                          }
237                  }                  }
238                  if ($swish_data) {                  if ($swish_data) {
                         my $i = Text::Iconv->new($config->{isis_codepage},'ISO8859-2');  
239                          # remove extra spaces                          # remove extra spaces
240                          $swish_data =~ s/ +/ /g;                          $swish_data =~ s/ +/ /g;
241                          $swish_data =~ s/ +$//g;                          $swish_data =~ s/ +$//g;
242    
243                          $swish_data = $i->convert($swish_data);                          $xml .= xmlify($field."_swish", unac_string($codepage,$swish_data));
                         $xml .= xmlify($field."_swish",unac_string('ISO8859-2',$swish_data));  
                         #$swish_data = $isis_codepage->convert($swish_data)."##" || $swish_data;  
                         #$xml .= xmlify($field."_swish",unac_string($config->{isis_codepage},$swish_data));  
244                  }                  }
245    
246    
# Line 212  sub isis2xml { Line 248  sub isis2xml {
248    
249          # dump formatted output in <html>          # dump formatted output in <html>
250          if ($html) {          if ($html) {
251                  $xml .= xmlify("html",$html);                  #$xml .= xmlify("html",$html);
252                    $xml .= "<html><![CDATA[ $html ]]></html>";
253          }          }
254                    
255          if ($xml) {          if ($xml) {
 #print STDERR "x: $xml\n";  
256                  $xml .= $add_xml if ($add_xml);                  $xml .= $add_xml if ($add_xml);
257                  return "<xml>\n$xml</xml>\n";                  return "<xml>\n$xml</xml>\n";
258          } else {          } else {
# Line 226  sub isis2xml { Line 262  sub isis2xml {
262    
263  ##########################################################################  ##########################################################################
264    
265    # read configuration for this script
266  my $cfg = new Config::IniFiles( -file => $config_file );  my $cfg = new Config::IniFiles( -file => $config_file );
267    
268    # read global.conf configuration
269    my $cfg_global = new Config::IniFiles( -file => 'global.conf' );
270    
271    # open index
272    $index = new index_DBI(
273                    $cfg_global->val('global', 'dbi_dbd'),
274                    $cfg_global->val('global', 'dbi_dsn'),
275                    $cfg_global->val('global', 'dbi_user'),
276                    $cfg_global->val('global', 'dbi_passwd') || '',
277            );
278    
279    my $show_progress = $cfg_global->val('global', 'show_progress');
280    
281  foreach my $database ($cfg->Sections) {  foreach my $database ($cfg->Sections) {
282    
283          my $isis_db = $cfg -> val($database, 'isis_db');          my $type = lc($cfg -> val($database, 'type')) || die "$database doesn't have 'type' defined";
284          my $type = $cfg -> val($database, 'type');          my $add_xml = $cfg -> val($database, 'xml');    # optional
         my $add_xml = $cfg -> val($database, 'xml');  
   
         # read configuration for this type  
         $config=XMLin("./import_xml/$type.xml", forcearray => [ 'isis' ], forcecontent => 1);  
         $isis_codepage = Text::Iconv->new($config->{isis_codepage},$XML_CHARSET);  
         $index_codepage = Text::Iconv->new($config->{isis_codepage},$config->{index_codepage});  
         $xml_codepage = Text::Iconv->new($cfg->val($database,'xml_codepage'),$XML_CHARSET);  
   
         my $db = OpenIsis::open( $isis_db );  
         if (0) {  
 #       # FIX  
 #       if (! $db ) {  
                 print STDERR "WARNING: can't open '$isis_db'\n";  
                 next ;  
         }  
285    
286          my $max_rowid = OpenIsis::maxRowid( $db );  print STDERR "reading ./import_xml/$type.xml\n";
287    
288          print STDERR "Reading database: $isis_db [$max_rowid rows]\n";          # extract just type basic
289            my $type_base = $type;
290            $type_base =~ s/_.+$//g;
291    
292          my $path = $database;                   # was $isis_db          $config=XMLin("./import_xml/$type.xml", forcearray => [ $type2tag{$type_base}, 'config' ], forcecontent => 1);
293    
294            # output current progress indicator
295          my $last_p = 0;          my $last_p = 0;
296            sub progress {
297                    return if (! $show_progress);
298                    my $current = shift;
299                    my $total = shift || 1;
300                    my $p = int($current * 100 / $total);
301                    if ($p != $last_p) {
302                            printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$current,$total,"=" x ($p/2).">", $p );
303                            $last_p = $p;
304                    }
305            }
306    
307            my $fake_dir = 1;
308            sub fakeprogress {
309                    return if (! $show_progress);
310                    my $current = shift @_;
311    
312                    my @ind = ('-','\\','|','/','-','\\','|','/', '-');
313    
314                    $last_p += $fake_dir;
315                    $fake_dir = -$fake_dir if ($last_p > 1000 || $last_p < 0);
316                    if ($last_p % 10 == 0) {
317                            printf STDERR ("%5d / %5s [%-51s]\r",$current,"?"," " x ($last_p/20).$ind[($last_p/20) % $#ind]);
318                    }
319            }
320    
321            # now read database
322    print STDERR "using: $type...\n";
323    
324            if ($type_base eq "isis") {
325    
326                    my $isis_db = $cfg -> val($database, 'isis_db') || die "$database doesn't have 'isis_db' defined!";
327    
328                    $import2cp = Text::Iconv->new($config->{isis_codepage},$codepage);
329                    my $db = OpenIsis::open( $isis_db );
330    
331                    # check if .txt database for OpenIsis is zero length,
332                    # if so, erase it and re-open database
333                    sub check_txt_db {
334                            my $isis_db = shift || die "need isis database name";
335                            my $reopen = 0;
336    
337                            if (-e $isis_db.".TXT") {
338                                    print STDERR "WARNING: removing $isis_db.TXT OpenIsis database...\n";
339                                    unlink $isis_db.".TXT" || warn "FATAL: unlink error on '$isis_db.TXT': $!";
340                                    $reopen++;
341                            }
342                            if (-e $isis_db.".PTR") {
343                                    print STDERR "WARNING: removing $isis_db.PTR OpenIsis database...\n";
344                                    unlink $isis_db.".PTR" || warn "FATAL: unlink error on '$isis_db.PTR': $!";
345                                    $reopen++;
346                            }
347                            return OpenIsis::open( $isis_db ) if ($reopen);
348                    }
349    
350  #       { my $row_id = 4514;                  # EOF error
351  # FIX                  if ($db == -1) {
352          for (my $row_id = 1; $row_id <= $max_rowid; $row_id++ ) {                          $db = check_txt_db($isis_db);
353                  my $row = OpenIsis::read( $db, $row_id );                          if ($db == -1) {
354                  if ($row && $row->{mfn}) {                                  print STDERR "FATAL: OpenIsis can't open zero size file $isis_db\n";
355  #print STDERR "mfn: ",$row->{mfn},"\n";                                  next;
356                          # output current process indicator                          }
357                          my $p = int($row->{mfn} * 100 / $max_rowid);                  }
358                          if ($p != $last_p) {  
359                                  printf STDERR ("%5d / %5d [%-51s] %-2d %% \r",$row->{mfn},$max_rowid,"=" x ($p/2).">", $p ) if (! $opts{q});                  # OpenIsis::ERR_BADF
360                                  $last_p = $p;                  if ($db == -4) {
361                          }                          print STDERR "FATAL: OpenIsis can't find file $isis_db\n";
362                            next;
363                          if (my $xml = isis2xml($row,$add_xml)) {                  # OpenIsis::ERR_IO
364  #print STDERR "--ret-->$xml\n";                  } elsif ($db == -5) {
365                                  print "Path-Name: $path#".int($row->{mfn})."\n";                          print STDERR "FATAL: OpenIsis can't access file $isis_db\n";
366                            next;
367                    } elsif ($db < 0) {
368                            print STDERR "FATAL: OpenIsis unknown error $db with file $isis_db\n";
369                            next;
370                    }
371    
372                    my $max_rowid = OpenIsis::maxRowid( $db );
373    
374                    # if 0 records, try to rease isis .txt database
375                    if ($max_rowid == 0) {
376                            # force removal of database
377                            $db = check_txt_db($isis_db);
378                            $max_rowid = OpenIsis::maxRowid( $db );
379                    }
380    
381                    print STDERR "Reading database: $isis_db [$max_rowid rows]\n";
382    
383                    my $path = $database;
384    
385                    for (my $row_id = 1; $row_id <= $max_rowid; $row_id++ ) {
386                            my $row = OpenIsis::read( $db, $row_id );
387                            if ($row && $row->{mfn}) {
388            
389                                    progress($row->{mfn}, $max_rowid);
390    
391                                    my $swishpath = $path."#".int($row->{mfn});
392    
393                                    if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
394                                            $xml = $cp2utf->convert($xml);
395                                            use bytes;      # as opposed to chars
396                                            print "Path-Name: $swishpath\n";
397                                            print "Content-Length: ".(length($xml)+1)."\n";
398                                            print "Document-Type: XML\n\n$xml\n";
399                                    }
400                            }
401                    }
402                    # for this to work with current version of OpenIsis (0.9.0)
403                    # you might need my patch from
404                    # http://www.rot13.org/~dpavlin/projects/openisis-0.9.0-perl_close.diff
405                    OpenIsis::close($db);
406                    print STDERR "\n";
407    
408            } elsif ($type_base eq "excel") {
409                    use Spreadsheet::ParseExcel;
410                    use Spreadsheet::ParseExcel::Utility qw(int2col);
411                    
412                    $import2cp = Text::Iconv->new($config->{excel_codepage},$codepage);
413                    my $excel_file = $cfg -> val($database, 'excel_file') || die "$database doesn't have 'excel_file' defined!";
414    
415                    my $sheet = x($config->{sheet}) || die "no sheet in $type.xml";
416                    my $start_row = x($config->{start_row}) - 1 || die "no start_row in $type.xml";
417    
418                    my $oBook = Spreadsheet::ParseExcel::Workbook->Parse($excel_file) || die "can't open Excel file '$excel_file'";
419    
420                    my $sheet_nr = 0;
421                    foreach my $oWks (@{$oBook->{Worksheet}}) {
422                            #print STDERR "-- SHEET $sheet_nr:", $oWks->{Name}, "\n";
423                            last if ($oWks->{Name} eq $sheet);
424                            $sheet_nr++;
425                    }
426    
427                    my $oWorksheet = $oBook->{Worksheet}[$sheet_nr];
428            
429                    print STDERR "using sheet: ",$oWorksheet->{Name},"\n";
430                    defined ($oWorksheet) || die "can't find sheet '$sheet' in $excel_file";
431                    my $end_row = x($config->{end_row}) || $oWorksheet->{MaxRow};
432    
433                    for(my $iR = $start_row ; defined $end_row && $iR <= $end_row ; $iR++) {
434                            my $row;
435                            for(my $iC = $oWorksheet->{MinCol} ; defined $oWorksheet->{MaxCol} && $iC <= $oWorksheet->{MaxCol} ; $iC++) {
436                                    my $cell = $oWorksheet->{Cells}[$iR][$iC];
437                                    if ($cell) {
438                                            $row->{int2col($iC)} = $cell->Value;
439                                    }
440                            }
441    
442                            progress($iR, $end_row);
443    
444    #                       print "row[$iR/$end_row] ";
445    #                       foreach (keys %{$row}) {
446    #                               print "$_: ",$row->{$_},"\t";
447    #                       }
448    #                       print "\n";
449    
450                            my $swishpath = $database."#".$iR;
451    
452                            next if (! $row);
453    
454                            if (my $xml = data2xml($type_base,$row,$add_xml,$cfg,$database)) {
455                                    $xml = $cp2utf->convert($xml);
456                                    use bytes;      # as opposed to chars
457                                    print "Path-Name: $swishpath\n";
458                                  print "Content-Length: ".(length($xml)+1)."\n";                                  print "Content-Length: ".(length($xml)+1)."\n";
459                                  print "Document-Type: XML\n\n$xml\n";                                  print "Document-Type: XML\n\n$xml\n";
460                          }                          }
461                  }                  }
462            } elsif ($type_base eq "marc") {
463    
464                    use MARC;
465                    
466                    $import2cp = Text::Iconv->new($config->{marc_codepage},$codepage);
467                    my $marc_file = $cfg -> val($database, 'marc_file') || die "$database doesn't have 'marc_file' defined!";
468    
469                    # optional argument is format
470                    my $format = x($config->{format}) || 'usmarc';
471    
472                    print STDERR "Reading MARC file '$marc_file'\n";
473    
474                    my $marc = new MARC;
475                    my $nr = $marc->openmarc({
476                                    file=>$marc_file, format=>$format
477                            }) || die "Can't open MARC file '$marc_file'";
478    
479                    my $i=0;        # record nr.
480    
481                    my $rec;
482    
483                    while ($marc->nextmarc(1)) {
484    
485                            # XXX
486                            fakeprogress($i++);
487    
488                            my $swishpath = $database."#".$i;
489    
490                            if (my $xml = data2xml($type_base,$marc,$add_xml,$cfg,$database)) {
491                                    $xml = $cp2utf->convert($xml);
492                                    use bytes;      # as opposed to chars
493                                    print "Path-Name: $swishpath\n";
494                                    print "Content-Length: ".(length($xml)+1)."\n";
495                                    print "Document-Type: XML\n\n$xml\n";
496                            }
497                    }
498            } elsif ($type_base eq "feed") {
499    
500                    $import2cp = Text::Iconv->new($config->{feed_codepage},$codepage);
501                    my $prog = x($config->{prog}) || die "$database doesn't have 'prog' defined!";
502    
503                    print STDERR "Reading feed from program '$prog'\n";
504    
505                    open(FEED,"feeds/$prog |") || die "can't start $prog: $!";
506    
507                    my $i=1;        # record nr.
508    
509                    my $data;
510                    my $line=1;
511    
512                    while (<FEED>) {
513                            chomp;
514    
515                            if (/^$/) {
516                                    my $swishpath = $database."#".$i++;
517    
518                                    if (my $xml = data2xml($type_base,$data,$add_xml,$cfg,$database)) {
519                                            $xml = $cp2utf->convert($xml);
520                                            use bytes;      # as opposed to chars
521                                            print "Path-Name: $swishpath\n";
522                                            print "Content-Length: ".(length($xml)+1)."\n";
523                                            print "Document-Type: XML\n\n$xml\n";
524                                    }
525                                    $line = 1;
526                                    $data = {};
527                                    next;
528                            }
529    
530                            $line = $1 if (s/^(\d+):\s*//);
531                            $data->{$line++} = $_;
532    
533                            fakeprogress($i);
534    
535                    }
536          }          }
         print STDERR "\n";  
537  }  }
538    
539  # call this to commit index  # call this to commit index
# Line 289  __END__ Line 545  __END__
545    
546  =head1 NAME  =head1 NAME
547    
548  isis2xml.pl - read isis file and dump XML  all2xml.pl - read various file formats and dump XML for SWISH-E
549    
550  =head1 DESCRIPTION  =head1 DESCRIPTION
551    
552  This command will read ISIS data file using OpenIsis perl module and  This command will read ISIS data file using OpenIsis perl module, MARC
553  create XML file for usage with I<SWISH-E>  records using MARC module and optionally Micro$oft Excel files to
554  indexer. Dispite it's name, this script B<isn't general xml generator>  create one XML file for usage with I<SWISH-E> indexer. Dispite it's name,
555  from isis files (isis allready has something like that). Output of this  this script B<isn't general xml generator> from isis files (isis allready
556  script is tailor-made for SWISH-E.  has something like that). Output of this script is tailor-made for SWISH-E.
557    
558    =head1 BUGS
559    
560    Documentation is really lacking. However, in true Open Source spirit, source
561    is best documentation. I even made considerable effort to comment parts
562    which are not intuitively clear, so...
563    
564  =head1 AUTHOR  =head1 AUTHOR
565    

Legend:
Removed from v.32  
changed lines
  Added in v.135

  ViewVC Help
Powered by ViewVC 1.1.26