Parent Directory
|
Revision Log
|
Patch
| revision 1.72 by wakaba, Sun Mar 2 14:32:26 2008 UTC | revision 1.100 by wakaba, Sun Mar 9 04:08:41 2008 UTC | |
|---|---|---|
| # | Line 179 sub parse_string ($$$;$) { | Line 179 sub parse_string ($$$;$) { |
| 179 | my $i = 0; | my $i = 0; |
| 180 | my $line = 1; | my $line = 1; |
| 181 | my $column = 0; | my $column = 0; |
| 182 | $self->{set_next_input_character} = sub { | $self->{set_next_char} = sub { |
| 183 | my $self = shift; | my $self = shift; |
| 184 | ||
| 185 | pop @{$self->{prev_input_character}}; | pop @{$self->{prev_char}}; |
| 186 | unshift @{$self->{prev_input_character}}, $self->{next_input_character}; | unshift @{$self->{prev_char}}, $self->{next_char}; |
| 187 | ||
| 188 | $self->{next_input_character} = -1 and return if $i >= length $$s; | $self->{next_char} = -1 and return if $i >= length $$s; |
| 189 | $self->{next_input_character} = ord substr $$s, $i++, 1; | $self->{next_char} = ord substr $$s, $i++, 1; |
| 190 | $column++; | $column++; |
| 191 | ||
| 192 | if ($self->{next_input_character} == 0x000A) { # LF | if ($self->{next_char} == 0x000A) { # LF |
| 193 | $line++; | $line++; |
| 194 | $column = 0; | $column = 0; |
| 195 | } elsif ($self->{next_input_character} == 0x000D) { # CR | } elsif ($self->{next_char} == 0x000D) { # CR |
| 196 | $i++ if substr ($$s, $i, 1) eq "\x0A"; | $i++ if substr ($$s, $i, 1) eq "\x0A"; |
| 197 | $self->{next_input_character} = 0x000A; # LF # MUST | $self->{next_char} = 0x000A; # LF # MUST |
| 198 | $line++; | $line++; |
| 199 | $column = 0; | $column = 0; |
| 200 | } elsif ($self->{next_input_character} > 0x10FFFF) { | } elsif ($self->{next_char} > 0x10FFFF) { |
| 201 | $self->{next_input_character} = 0xFFFD; # REPLACEMENT CHARACTER # MUST | $self->{next_char} = 0xFFFD; # REPLACEMENT CHARACTER # MUST |
| 202 | } elsif ($self->{next_input_character} == 0x0000) { # NULL | } elsif ($self->{next_char} == 0x0000) { # NULL |
| 203 | !!!parse-error (type => 'NULL'); | !!!parse-error (type => 'NULL'); |
| 204 | $self->{next_input_character} = 0xFFFD; # REPLACEMENT CHARACTER # MUST | $self->{next_char} = 0xFFFD; # REPLACEMENT CHARACTER # MUST |
| 205 | } | } |
| 206 | }; | }; |
| 207 | $self->{prev_input_character} = [-1, -1, -1]; | $self->{prev_char} = [-1, -1, -1]; |
| 208 | $self->{next_input_character} = -1; | $self->{next_char} = -1; |
| 209 | ||
| 210 | my $onerror = $_[2] || sub { | my $onerror = $_[2] || sub { |
| 211 | my (%opt) = @_; | my (%opt) = @_; |
| # | Line 226 sub parse_string ($$$;$) { | Line 226 sub parse_string ($$$;$) { |
| 226 | sub new ($) { | sub new ($) { |
| 227 | my $class = shift; | my $class = shift; |
| 228 | my $self = bless {}, $class; | my $self = bless {}, $class; |
| 229 | $self->{set_next_input_character} = sub { | $self->{set_next_char} = sub { |
| 230 | $self->{next_input_character} = -1; | $self->{next_char} = -1; |
| 231 | }; | }; |
| 232 | $self->{parse_error} = sub { | $self->{parse_error} = sub { |
| 233 | # | # |
| # | Line 304 sub ROW_IMS () { 0b10000000 } | Line 304 sub ROW_IMS () { 0b10000000 } |
| 304 | sub BODY_AFTER_IMS () { 0b100000000 } | sub BODY_AFTER_IMS () { 0b100000000 } |
| 305 | sub FRAME_IMS () { 0b1000000000 } | sub FRAME_IMS () { 0b1000000000 } |
| 306 | ||
| 307 | ## NOTE: "initial" and "before html" insertion modes have no constants. | |
| 308 | ||
| 309 | ## NOTE: "after after body" insertion mode. | |
| 310 | sub AFTER_HTML_BODY_IM () { AFTER_HTML_IMS | BODY_AFTER_IMS } | sub AFTER_HTML_BODY_IM () { AFTER_HTML_IMS | BODY_AFTER_IMS } |
| 311 | ||
| 312 | ## NOTE: "after after frameset" insertion mode. | |
| 313 | sub AFTER_HTML_FRAMESET_IM () { AFTER_HTML_IMS | FRAME_IMS } | sub AFTER_HTML_FRAMESET_IM () { AFTER_HTML_IMS | FRAME_IMS } |
| 314 | ||
| 315 | sub IN_HEAD_IM () { HEAD_IMS | 0b00 } | sub IN_HEAD_IM () { HEAD_IMS | 0b00 } |
| 316 | sub IN_HEAD_NOSCRIPT_IM () { HEAD_IMS | 0b01 } | sub IN_HEAD_NOSCRIPT_IM () { HEAD_IMS | 0b01 } |
| 317 | sub AFTER_HEAD_IM () { HEAD_IMS | 0b10 } | sub AFTER_HEAD_IM () { HEAD_IMS | 0b10 } |
| # | Line 333 sub _initialize_tokenizer ($) { | Line 339 sub _initialize_tokenizer ($) { |
| 339 | undef $self->{last_emitted_start_tag_name}; | undef $self->{last_emitted_start_tag_name}; |
| 340 | undef $self->{last_attribute_value_state}; | undef $self->{last_attribute_value_state}; |
| 341 | $self->{char} = []; | $self->{char} = []; |
| 342 | # $self->{next_input_character} | # $self->{next_char} |
| 343 | !!!next-input-character; | !!!next-input-character; |
| 344 | $self->{token} = []; | $self->{token} = []; |
| 345 | # $self->{escape} | # $self->{escape} |
| # | Line 346 sub _initialize_tokenizer ($) { | Line 352 sub _initialize_tokenizer ($) { |
| 352 | ## ->{tag_name} (START_TAG_TOKEN, END_TAG_TOKEN) | ## ->{tag_name} (START_TAG_TOKEN, END_TAG_TOKEN) |
| 353 | ## ->{public_identifier} (DOCTYPE_TOKEN) | ## ->{public_identifier} (DOCTYPE_TOKEN) |
| 354 | ## ->{system_identifier} (DOCTYPE_TOKEN) | ## ->{system_identifier} (DOCTYPE_TOKEN) |
| 355 | ## ->{correct} == 1 or 0 (DOCTYPE_TOKEN) | ## ->{quirks} == 1 or 0 (DOCTYPE_TOKEN): "force-quirks" flag |
| 356 | ## ->{attributes} isa HASH (START_TAG_TOKEN, END_TAG_TOKEN) | ## ->{attributes} isa HASH (START_TAG_TOKEN, END_TAG_TOKEN) |
| 357 | ## ->{name} | ## ->{name} |
| 358 | ## ->{value} | ## ->{value} |
| # | Line 384 sub _get_next_token ($) { | Line 390 sub _get_next_token ($) { |
| 390 | ||
| 391 | A: { | A: { |
| 392 | if ($self->{state} == DATA_STATE) { | if ($self->{state} == DATA_STATE) { |
| 393 | if ($self->{next_input_character} == 0x0026) { # & | if ($self->{next_char} == 0x0026) { # & |
| 394 | if ($self->{content_model} & CM_ENTITY and # PCDATA | RCDATA | if ($self->{content_model} & CM_ENTITY and # PCDATA | RCDATA |
| 395 | not $self->{escape}) { | not $self->{escape}) { |
| 396 | !!!cp (1); | |
| 397 | $self->{state} = ENTITY_DATA_STATE; | $self->{state} = ENTITY_DATA_STATE; |
| 398 | !!!next-input-character; | !!!next-input-character; |
| 399 | redo A; | redo A; |
| 400 | } else { | } else { |
| 401 | !!!cp (2); | |
| 402 | # | # |
| 403 | } | } |
| 404 | } elsif ($self->{next_input_character} == 0x002D) { # - | } elsif ($self->{next_char} == 0x002D) { # - |
| 405 | if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA | if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA |
| 406 | unless ($self->{escape}) { | unless ($self->{escape}) { |
| 407 | if ($self->{prev_input_character}->[0] == 0x002D and # - | if ($self->{prev_char}->[0] == 0x002D and # - |
| 408 | $self->{prev_input_character}->[1] == 0x0021 and # ! | $self->{prev_char}->[1] == 0x0021 and # ! |
| 409 | $self->{prev_input_character}->[2] == 0x003C) { # < | $self->{prev_char}->[2] == 0x003C) { # < |
| 410 | !!!cp (3); | |
| 411 | $self->{escape} = 1; | $self->{escape} = 1; |
| 412 | } else { | |
| 413 | !!!cp (4); | |
| 414 | } | } |
| 415 | } else { | |
| 416 | !!!cp (5); | |
| 417 | } | } |
| 418 | } | } |
| 419 | ||
| 420 | # | # |
| 421 | } elsif ($self->{next_input_character} == 0x003C) { # < | } elsif ($self->{next_char} == 0x003C) { # < |
| 422 | if ($self->{content_model} & CM_FULL_MARKUP or # PCDATA | if ($self->{content_model} & CM_FULL_MARKUP or # PCDATA |
| 423 | (($self->{content_model} & CM_LIMITED_MARKUP) and # CDATA | RCDATA | (($self->{content_model} & CM_LIMITED_MARKUP) and # CDATA | RCDATA |
| 424 | not $self->{escape})) { | not $self->{escape})) { |
| 425 | !!!cp (6); | |
| 426 | $self->{state} = TAG_OPEN_STATE; | $self->{state} = TAG_OPEN_STATE; |
| 427 | !!!next-input-character; | !!!next-input-character; |
| 428 | redo A; | redo A; |
| 429 | } else { | } else { |
| 430 | !!!cp (7); | |
| 431 | # | # |
| 432 | } | } |
| 433 | } elsif ($self->{next_input_character} == 0x003E) { # > | } elsif ($self->{next_char} == 0x003E) { # > |
| 434 | if ($self->{escape} and | if ($self->{escape} and |
| 435 | ($self->{content_model} & CM_LIMITED_MARKUP)) { # RCDATA | CDATA | ($self->{content_model} & CM_LIMITED_MARKUP)) { # RCDATA | CDATA |
| 436 | if ($self->{prev_input_character}->[0] == 0x002D and # - | if ($self->{prev_char}->[0] == 0x002D and # - |
| 437 | $self->{prev_input_character}->[1] == 0x002D) { # - | $self->{prev_char}->[1] == 0x002D) { # - |
| 438 | !!!cp (8); | |
| 439 | delete $self->{escape}; | delete $self->{escape}; |
| 440 | } else { | |
| 441 | !!!cp (9); | |
| 442 | } | } |
| 443 | } else { | |
| 444 | !!!cp (10); | |
| 445 | } | } |
| 446 | ||
| 447 | # | # |
| 448 | } elsif ($self->{next_input_character} == -1) { | } elsif ($self->{next_char} == -1) { |
| 449 | !!!cp (11); | |
| 450 | !!!emit ({type => END_OF_FILE_TOKEN}); | !!!emit ({type => END_OF_FILE_TOKEN}); |
| 451 | last A; ## TODO: ok? | last A; ## TODO: ok? |
| 452 | } else { | |
| 453 | !!!cp (12); | |
| 454 | } | } |
| 455 | # Anything else | # Anything else |
| 456 | my $token = {type => CHARACTER_TOKEN, | my $token = {type => CHARACTER_TOKEN, |
| 457 | data => chr $self->{next_input_character}}; | data => chr $self->{next_char}}; |
| 458 | ## Stay in the data state | ## Stay in the data state |
| 459 | !!!next-input-character; | !!!next-input-character; |
| 460 | ||
| # | Line 447 sub _get_next_token ($) { | Line 470 sub _get_next_token ($) { |
| 470 | # next-input-character is already done | # next-input-character is already done |
| 471 | ||
| 472 | unless (defined $token) { | unless (defined $token) { |
| 473 | !!!cp (13); | |
| 474 | !!!emit ({type => CHARACTER_TOKEN, data => '&'}); | !!!emit ({type => CHARACTER_TOKEN, data => '&'}); |
| 475 | } else { | } else { |
| 476 | !!!cp (14); | |
| 477 | !!!emit ($token); | !!!emit ($token); |
| 478 | } | } |
| 479 | ||
| 480 | redo A; | redo A; |
| 481 | } elsif ($self->{state} == TAG_OPEN_STATE) { | } elsif ($self->{state} == TAG_OPEN_STATE) { |
| 482 | if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA | if ($self->{content_model} & CM_LIMITED_MARKUP) { # RCDATA | CDATA |
| 483 | if ($self->{next_input_character} == 0x002F) { # / | if ($self->{next_char} == 0x002F) { # / |
| 484 | !!!cp (15); | |
| 485 | !!!next-input-character; | !!!next-input-character; |
| 486 | $self->{state} = CLOSE_TAG_OPEN_STATE; | $self->{state} = CLOSE_TAG_OPEN_STATE; |
| 487 | redo A; | redo A; |
| 488 | } else { | } else { |
| 489 | !!!cp (16); | |
| 490 | ## reconsume | ## reconsume |
| 491 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 492 | ||
| # | Line 468 sub _get_next_token ($) { | Line 495 sub _get_next_token ($) { |
| 495 | redo A; | redo A; |
| 496 | } | } |
| 497 | } elsif ($self->{content_model} & CM_FULL_MARKUP) { # PCDATA | } elsif ($self->{content_model} & CM_FULL_MARKUP) { # PCDATA |
| 498 | if ($self->{next_input_character} == 0x0021) { # ! | if ($self->{next_char} == 0x0021) { # ! |
| 499 | !!!cp (17); | |
| 500 | $self->{state} = MARKUP_DECLARATION_OPEN_STATE; | $self->{state} = MARKUP_DECLARATION_OPEN_STATE; |
| 501 | !!!next-input-character; | !!!next-input-character; |
| 502 | redo A; | redo A; |
| 503 | } elsif ($self->{next_input_character} == 0x002F) { # / | } elsif ($self->{next_char} == 0x002F) { # / |
| 504 | !!!cp (18); | |
| 505 | $self->{state} = CLOSE_TAG_OPEN_STATE; | $self->{state} = CLOSE_TAG_OPEN_STATE; |
| 506 | !!!next-input-character; | !!!next-input-character; |
| 507 | redo A; | redo A; |
| 508 | } elsif (0x0041 <= $self->{next_input_character} and | } elsif (0x0041 <= $self->{next_char} and |
| 509 | $self->{next_input_character} <= 0x005A) { # A..Z | $self->{next_char} <= 0x005A) { # A..Z |
| 510 | !!!cp (19); | |
| 511 | $self->{current_token} | $self->{current_token} |
| 512 | = {type => START_TAG_TOKEN, | = {type => START_TAG_TOKEN, |
| 513 | tag_name => chr ($self->{next_input_character} + 0x0020)}; | tag_name => chr ($self->{next_char} + 0x0020)}; |
| 514 | $self->{state} = TAG_NAME_STATE; | $self->{state} = TAG_NAME_STATE; |
| 515 | !!!next-input-character; | !!!next-input-character; |
| 516 | redo A; | redo A; |
| 517 | } elsif (0x0061 <= $self->{next_input_character} and | } elsif (0x0061 <= $self->{next_char} and |
| 518 | $self->{next_input_character} <= 0x007A) { # a..z | $self->{next_char} <= 0x007A) { # a..z |
| 519 | !!!cp (20); | |
| 520 | $self->{current_token} = {type => START_TAG_TOKEN, | $self->{current_token} = {type => START_TAG_TOKEN, |
| 521 | tag_name => chr ($self->{next_input_character})}; | tag_name => chr ($self->{next_char})}; |
| 522 | $self->{state} = TAG_NAME_STATE; | $self->{state} = TAG_NAME_STATE; |
| 523 | !!!next-input-character; | !!!next-input-character; |
| 524 | redo A; | redo A; |
| 525 | } elsif ($self->{next_input_character} == 0x003E) { # > | } elsif ($self->{next_char} == 0x003E) { # > |
| 526 | !!!cp (21); | |
| 527 | !!!parse-error (type => 'empty start tag'); | !!!parse-error (type => 'empty start tag'); |
| 528 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 529 | !!!next-input-character; | !!!next-input-character; |
| # | Line 499 sub _get_next_token ($) { | Line 531 sub _get_next_token ($) { |
| 531 | !!!emit ({type => CHARACTER_TOKEN, data => '<>'}); | !!!emit ({type => CHARACTER_TOKEN, data => '<>'}); |
| 532 | ||
| 533 | redo A; | redo A; |
| 534 | } elsif ($self->{next_input_character} == 0x003F) { # ? | } elsif ($self->{next_char} == 0x003F) { # ? |
| 535 | !!!cp (22); | |
| 536 | !!!parse-error (type => 'pio'); | !!!parse-error (type => 'pio'); |
| 537 | $self->{state} = BOGUS_COMMENT_STATE; | $self->{state} = BOGUS_COMMENT_STATE; |
| 538 | ## $self->{next_input_character} is intentionally left as is | ## $self->{next_char} is intentionally left as is |
| 539 | redo A; | redo A; |
| 540 | } else { | } else { |
| 541 | !!!cp (23); | |
| 542 | !!!parse-error (type => 'bare stago'); | !!!parse-error (type => 'bare stago'); |
| 543 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 544 | ## reconsume | ## reconsume |
| # | Line 522 sub _get_next_token ($) { | Line 556 sub _get_next_token ($) { |
| 556 | ## NOTE: <http://krijnhoetmer.nl/irc-logs/whatwg/20070626#l-564> | ## NOTE: <http://krijnhoetmer.nl/irc-logs/whatwg/20070626#l-564> |
| 557 | my @next_char; | my @next_char; |
| 558 | TAGNAME: for (my $i = 0; $i < length $self->{last_emitted_start_tag_name}; $i++) { | TAGNAME: for (my $i = 0; $i < length $self->{last_emitted_start_tag_name}; $i++) { |
| 559 | push @next_char, $self->{next_input_character}; | push @next_char, $self->{next_char}; |
| 560 | my $c = ord substr ($self->{last_emitted_start_tag_name}, $i, 1); | my $c = ord substr ($self->{last_emitted_start_tag_name}, $i, 1); |
| 561 | my $C = 0x0061 <= $c && $c <= 0x007A ? $c - 0x0020 : $c; | my $C = 0x0061 <= $c && $c <= 0x007A ? $c - 0x0020 : $c; |
| 562 | if ($self->{next_input_character} == $c or $self->{next_input_character} == $C) { | if ($self->{next_char} == $c or $self->{next_char} == $C) { |
| 563 | !!!cp (24); | |
| 564 | !!!next-input-character; | !!!next-input-character; |
| 565 | next TAGNAME; | next TAGNAME; |
| 566 | } else { | } else { |
| 567 | $self->{next_input_character} = shift @next_char; # reconsume | !!!cp (25); |
| 568 | $self->{next_char} = shift @next_char; # reconsume | |
| 569 | !!!back-next-input-character (@next_char); | !!!back-next-input-character (@next_char); |
| 570 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 571 | ||
| # | Line 538 sub _get_next_token ($) { | Line 574 sub _get_next_token ($) { |
| 574 | redo A; | redo A; |
| 575 | } | } |
| 576 | } | } |
| 577 | push @next_char, $self->{next_input_character}; | push @next_char, $self->{next_char}; |
| 578 | ||
| 579 | unless ($self->{next_input_character} == 0x0009 or # HT | unless ($self->{next_char} == 0x0009 or # HT |
| 580 | $self->{next_input_character} == 0x000A or # LF | $self->{next_char} == 0x000A or # LF |
| 581 | $self->{next_input_character} == 0x000B or # VT | $self->{next_char} == 0x000B or # VT |
| 582 | $self->{next_input_character} == 0x000C or # FF | $self->{next_char} == 0x000C or # FF |
| 583 | $self->{next_input_character} == 0x0020 or # SP | $self->{next_char} == 0x0020 or # SP |
| 584 | $self->{next_input_character} == 0x003E or # > | $self->{next_char} == 0x003E or # > |
| 585 | $self->{next_input_character} == 0x002F or # / | $self->{next_char} == 0x002F or # / |
| 586 | $self->{next_input_character} == -1) { | $self->{next_char} == -1) { |
| 587 | $self->{next_input_character} = shift @next_char; # reconsume | !!!cp (26); |
| 588 | $self->{next_char} = shift @next_char; # reconsume | |
| 589 | !!!back-next-input-character (@next_char); | !!!back-next-input-character (@next_char); |
| 590 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 591 | !!!emit ({type => CHARACTER_TOKEN, data => '</'}); | !!!emit ({type => CHARACTER_TOKEN, data => '</'}); |
| 592 | redo A; | redo A; |
| 593 | } else { | } else { |
| 594 | $self->{next_input_character} = shift @next_char; | !!!cp (27); |
| 595 | $self->{next_char} = shift @next_char; | |
| 596 | !!!back-next-input-character (@next_char); | !!!back-next-input-character (@next_char); |
| 597 | # and consume... | # and consume... |
| 598 | } | } |
| 599 | } else { | } else { |
| 600 | ## No start tag token has ever been emitted | ## No start tag token has ever been emitted |
| 601 | !!!cp (28); | |
| 602 | # next-input-character is already done | # next-input-character is already done |
| 603 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 604 | !!!emit ({type => CHARACTER_TOKEN, data => '</'}); | !!!emit ({type => CHARACTER_TOKEN, data => '</'}); |
| # | Line 567 sub _get_next_token ($) { | Line 606 sub _get_next_token ($) { |
| 606 | } | } |
| 607 | } | } |
| 608 | ||
| 609 | if (0x0041 <= $self->{next_input_character} and | if (0x0041 <= $self->{next_char} and |
| 610 | $self->{next_input_character} <= 0x005A) { # A..Z | $self->{next_char} <= 0x005A) { # A..Z |
| 611 | !!!cp (29); | |
| 612 | $self->{current_token} = {type => END_TAG_TOKEN, | $self->{current_token} = {type => END_TAG_TOKEN, |
| 613 | tag_name => chr ($self->{next_input_character} + 0x0020)}; | tag_name => chr ($self->{next_char} + 0x0020)}; |
| 614 | $self->{state} = TAG_NAME_STATE; | $self->{state} = TAG_NAME_STATE; |
| 615 | !!!next-input-character; | !!!next-input-character; |
| 616 | redo A; | redo A; |
| 617 | } elsif (0x0061 <= $self->{next_input_character} and | } elsif (0x0061 <= $self->{next_char} and |
| 618 | $self->{next_input_character} <= 0x007A) { # a..z | $self->{next_char} <= 0x007A) { # a..z |
| 619 | !!!cp (30); | |
| 620 | $self->{current_token} = {type => END_TAG_TOKEN, | $self->{current_token} = {type => END_TAG_TOKEN, |
| 621 | tag_name => chr ($self->{next_input_character})}; | tag_name => chr ($self->{next_char})}; |
| 622 | $self->{state} = TAG_NAME_STATE; | $self->{state} = TAG_NAME_STATE; |
| 623 | !!!next-input-character; | !!!next-input-character; |
| 624 | redo A; | redo A; |
| 625 | } elsif ($self->{next_input_character} == 0x003E) { # > | } elsif ($self->{next_char} == 0x003E) { # > |
| 626 | !!!cp (31); | |
| 627 | !!!parse-error (type => 'empty end tag'); | !!!parse-error (type => 'empty end tag'); |
| 628 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 629 | !!!next-input-character; | !!!next-input-character; |
| 630 | redo A; | redo A; |
| 631 | } elsif ($self->{next_input_character} == -1) { | } elsif ($self->{next_char} == -1) { |
| 632 | !!!cp (32); | |
| 633 | !!!parse-error (type => 'bare etago'); | !!!parse-error (type => 'bare etago'); |
| 634 | $self->{state} = DATA_STATE; | $self->{state} = DATA_STATE; |
| 635 | # reconsume | # reconsume |
| # | Line 595 sub _get_next_token ($) { | Line 638 sub _get_next_token ($) { |
| 638 | ||
| 639 | redo A; | redo A; |
| 640 | } else { | } else { |
| 641 | !!!cp (33); | |
| 642 | !!!parse-error (type => 'bogus end tag'); | !!!parse-error (type => 'bogus end tag'); |
| 643 | $self->{state} = BOGUS_COMMENT_STATE; | $self->{state} = BOGUS_COMMENT_STATE; |
| 644 | ## $self->{next_input_character} is intentionally left as is | ## $self->{next_char} is intentionally left as is |
| 645 | redo A; | redo A; |
| 646 | } | } |
| 647 | } elsif ($self->{state} == TAG_NAME_STATE) { | } elsif ($self->{state} == TAG_NAME_STATE) { |
| 648 | if ($self->{next_input_character} == 0x0009 or # HT | if ($self->{next_char} == 0x0009 or # HT |
| 649 | $self->{next_input_character} == 0x000A or # LF | $self->{next_char} == 0x000A or # LF |
| 650 | $self->{next_input_character} == 0x000B or # VT | $self->{next_char} == 0x000B or # VT |
| 651 | $self->{next_input_character} == 0x000C or # FF | $self->{next_char} == 0x000C or # FF |
| 652 | $self->{next_input_character} == 0x0020) { # SP | $self->{next_char} == 0x0020) { # SP |
| 653 | !!!cp (34); | |
| 654 | $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE; | $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE; |
| 655 | !!!next-input-character; | !!!next-input-character; |
| 656 | redo A; | redo A; |
| 657 | } elsif ($self->{next_input_character} == 0x003E) { # > | } elsif ($self->{next_char} == 0x003E) { # > |
| 658 | if ($self->{current_token}->{type} == START_TAG_TOKEN) { | if ($self->{current_token}->{type} == START_TAG_TOKEN) { |
| 659 | !!!cp (35); | |
| 660 | $self->{current_token}->{first_start_tag} | $self->{current_token}->{first_start_tag} |
| 661 | = not defined $self->{last_emitted_start_tag_name}; | = not defined $self->{last_emitted_start_tag_name}; |
| 662 | $self->{last_emitted_start_tag_name} = $self->{current_token}->{tag_name}; | $self->{last_emitted_start_tag_name} = $self->{current_token}->{tag_name}; |
| 663 | } elsif ($self->{current_token}->{type} == END_TAG_TOKEN) { | } elsif ($self->{current_token}->{type} == END_TAG_TOKEN) { |
| 664 | $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST | $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST |
| 665 | if ($self->{current_token}->{attributes}) { | #if ($self->{current_token}->{attributes}) { |
| 666 | !!!parse-error (type => 'end tag attribute'); | # ## NOTE: This should never be reached. |
| 667 | } | # !!! cp (36); |
| 668 | # !!! parse-error (type => 'end tag attribute'); | |
| 669 | #} else { | |
| 670 | !!!cp (37); | |
| 671 | #} | |
| 672 | } else { | } else { |
| 673 | die "$0: $self->{current_token}->{type}: Unknown token type"; | die "$0: $self->{current_token}->{type}: Unknown token type"; |
| 674 | } | } |
| # | Line 628 sub _get_next_token ($) { | Line 678 sub _get_next_token ($) { |
| 678 | !!!emit ($self->{current_token}); # start tag or end tag | !!!emit ($self->{current_token}); # start tag or end tag |
| 679 | ||
| 680 | redo A; | redo A; |
| 681 | } elsif (0x0041 <= $self->{next_input_character} and | } elsif (0x0041 <= $self->{next_char} and |
| 682 | $self->{next_input_character} <= 0x005A) { # A..Z | $self->{next_char} <= 0x005A) { # A..Z |
| 683 | $self->{current_token}->{tag_name} .= chr ($self->{next_input_character} + 0x0020); | !!!cp (38); |
| 684 | $self->{current_token}->{tag_name} .= chr ($self->{next_char} + 0x0020); | |
| 685 | # start tag or end tag | # start tag or end tag |
| 686 | ## Stay in this state | ## Stay in this state |
| 687 | !!!next-input-character; | !!!next-input-character; |
| 688 | redo A; | redo A; |
| 689 | } elsif ($self->{next_input_character} == -1) { | } elsif ($self->{next_char} == -1) { |
| 690 | !!!parse-error (type => 'unclosed tag'); | !!!parse-error (type => 'unclosed tag'); |
| 691 | if ($self->{current_token}->{type} == START_TAG_TOKEN) { | if ($self->{current_token}->{type} == START_TAG_TOKEN) { |
| 692 | !!!cp (39); | |
| 693 | $self->{current_token}->{first_start_tag} | $self->{current_token}->{first_start_tag} |
| 694 | = not defined $self->{last_emitted_start_tag_name}; | = not defined $self->{last_emitted_start_tag_name}; |
| 695 | $self->{last_emitted_start_tag_name} = $self->{current_token}->{tag_name}; | $self->{last_emitted_start_tag_name} = $self->{current_token}->{tag_name}; |
| 696 | } elsif ($self->{current_token}->{type} == END_TAG_TOKEN) { | } elsif ($self->{current_token}->{type} == END_TAG_TOKEN) { |
| 697 | $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST | $self->{content_model} = PCDATA_CONTENT_MODEL; # MUST |
| 698 | if ($self->{current_token}->{attributes}) { | #if ($self->{current_token}->{attributes}) { |
| 699 | !!!parse-error (type => 'end tag attribute'); | # ## NOTE: This state should never be reached. |
| 700 | } | # !!! cp (40); |
| 701 | # !!! parse-error (type => 'end tag attribute'); | |
| 702 | #} else { | |
| 703 | !!!cp (41); | |
| 704 | #} | |
| 705 | } else { | } else { |
| 706 | die "$0: $self->{current_token}->{type}: Unknown token type"; | die "$0: $self->{current_token}->{type}: Unknown token type"; |
| 707 | } | } |
| # | Line 655 sub _get_next_token ($) { | Line 711 sub _get_next_token ($) { |
| 711 | !!!emit ($self->{current_token}); # start tag or end tag | !!!emit ($self->{current_token}); # start tag or end tag |
| 712 | ||
| 713 | redo A; | redo A; |
| 714 | } elsif ($self->{next_input_character} == 0x002F) { # / | } elsif ($self->{next_char} == 0x002F) { # / |
| 715 | !!!next-input-character; | !!!next-input-character; |
| 716 | if ($self->{next_input_character} == 0x003E and # > | if ($self->{next_char} == 0x003E and # > |
| 717 | $self->{current_token}->{type} == START_TAG_TOKEN and | $self->{current_token}->{type} == START_TAG_TOKEN and |
| 718 | $permitted_slash_tag_name->{$self->{current_token}->{tag_name}}) { | $permitted_slash_tag_name->{$self->{current_token}->{tag_name}}) { |
| 719 | # permitted slash | # permitted slash |
| 720 | !!!cp (42); | |
| 721 | # | # |
| 722 | } else { | } else { |
| 723 | !!!cp (43); | |
| 724 | !!!parse-error (type => 'nestc'); | !!!parse-error (type => 'nestc'); |
| 725 | } | } |
| 726 | $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE; | $self->{state} = BEFORE_ATTRIBUTE_NAME_STATE; |
| 727 | # next-input-character is already done | # next-input-character is already done |
| 728 | redo A; | redo A; |
| 729 | } else { | } else { |
| 730 | $self->{current_token}->{tag_name} .= chr $self->{next_input_character}; | !!!cp (44); |
| 731 | $self->{current_token}->{tag_name} .= chr $self->{next_char}; | |
| 732 | # start tag or end tag | # start tag or end tag |
| 733 | ## Stay in the state | ## Stay in the state |
| 734 | !!!next-input-character; | !!!next-input-character; |
| 735 | redo A; | redo A; |
| 736 | } | } |
| 737 | } elsif ($self->{state} == BEFORE_ATTRIBUTE_NAME_STATE) { | } elsif ($self->{state} == BEFORE_ATTRIBUTE_NAME_STATE) { |
| 738 | if ($self->{next_input_character} == 0x0009 or # HT | if ($self->{next_char} == 0x0009 or # HT |