{"as_of":"2026-08-17T16:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cfa45e1b3595c3ce7cfe2bd4727c97ba4de35a7cbe85e87a784dfe2b773f60e","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:51:51.260140Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11219/citation-record","integrity":"/paper/2411.11219/integrity","json":"/paper/2411.11219/citation-record.json","paper":"/paper/2411.11219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:53.032089Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"7fa17493-7fdc-4a58-9329-323dda9f8825","year":2018},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.760300Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:36cded2c7a3ce3563300c64714c6517ee8167f95f6e3479d9aa3654eea796123","observation_id":"cfcb1dca-9492-43bb-9f53-93c1fc5400a8","resolution":{"observed_at":"2026-08-12T18:51:53.038960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T18:51:50.769703Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.769703Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:869eacb13d9f9ec8bc6d0b0891a5384643fff9833906127de20e65cafde382bd","observation_id":"ed596de8-4d2b-42d5-bca6-f7660c7ef85f","resolution":{"observed_at":"2026-08-12T18:51:50.769703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.776195Z","title":"Momentum contrast for unsupervised visual representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.776195Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:021f4468b889b0559b9a4e34d88e5881c323ee7dbe22ab41d30874ea1ef61ab5","observation_id":"fcf23d59-0ff2-495a-ac06-a129da57c68a","resolution":{"observed_at":"2026-08-12T18:51:50.776195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.783247Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.783247Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:cb7e3febb3a0ec1ca89615cd682fb031cf4cf2c562d309cd823d171f33d852b2","observation_id":"f58e6fd3-0700-4869-901f-bfd79e4cdb88","resolution":{"observed_at":"2026-08-12T18:51:50.783247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-12T18:51:50.789743Z","title":"Beit: Bert pre-training of image transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.789743Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:2ea054d3c92c153d7e5b8077b046541a5e5ca2e86ee18e7af837961d17304450","observation_id":"00ff5207-7c73-482f-b8e4-d43d0f45d396","resolution":{"observed_at":"2026-08-12T18:51:50.789743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.796041Z","title":"Masked au- toencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.796041Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:fe6c6de81097b4c7e4d714fd9e60f9832f565ca78395e5bb4a06430e71613863","observation_id":"d8f214a5-cd92-45f6-85c0-69b4b94695b8","resolution":{"observed_at":"2026-08-12T18:51:50.796041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.957504Z","title":"Simmim: A simple framework for masked image modeling,","venue":null,"work_id":"9dcba293-8b34-41d4-9099-820e199209dd","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.805358Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:8674e6f587bfa2c4291e9809ce05a3c4056608d11c8195785b4e6ad9beb1fe18","observation_id":"e4dc2277-8f68-4774-87c0-54b6a897e8bc","resolution":{"observed_at":"2026-08-12T18:51:52.963075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.940283Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition,","venue":null,"work_id":"d85752df-df8c-4501-a140-536c1b1f50d0","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.816191Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:f6107e6d618f901dd6e564636875a326d48d493f3f10b8000dc026702c78cbd6","observation_id":"b08f27d2-29f0-450f-ace9-59ed3504491d","resolution":{"observed_at":"2026-08-12T18:51:52.946358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.837653Z","title":"Sequence-to-sequence contrastive learn- ing for text recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.837653Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:b81b6e8a791e3a31946bd61dd33f31ff6d5bfe109a97c6b6d3d49788998405e7","observation_id":"c8ab4525-95a7-48b8-864a-f1e500388b9f","resolution":{"observed_at":"2026-08-12T18:51:50.837653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.824630Z","title":"Perceiving stroke-semantic context: Hierarchical contrastive learning for robust scene text recognition,","venue":null,"work_id":"61999a0f-945b-47ab-8ac8-cd62afc91aa4","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.844333Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:e7cc5d4b415fdb6b02cf0231005b5f03fbd2cdfeb4c2fa63ad796090763f0649","observation_id":"88f6549d-a09e-4af1-a8f8-5efb4b2cafdb","resolution":{"observed_at":"2026-08-12T18:51:52.841789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.852070Z","title":"Reading and writing: Discriminative and generative modeling for self-supervised text recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.852070Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:ac305cb71b747641738b1f26487fb0f825a737d483ce0d019707dab3488bbd5e","observation_id":"33351973-32fb-4f94-9b5f-471929891d37","resolution":{"observed_at":"2026-08-12T18:51:50.852070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T18:51:50.857745Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.857745Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:591611eab62e45897329d8ef76efd8056a0c760bd5b98f458648d0fbc7f2ee2d","observation_id":"7229e8de-c376-4324-8a17-e29d8fa895b1","resolution":{"observed_at":"2026-08-12T18:51:50.857745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00311","last_updated":"2023-10-10T03:06:45Z","snapshot_observed_at":"2026-08-16T16:56:05.556941Z","submitted_at":"2022-06-01T08:27:19Z","title":"MaskOCR: Text Recognition with Masked Encoder-Decoder Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00311","snapshot_observed_at":"2026-08-12T18:51:50.864066Z","title":"Maskocr: Text recognition with masked encoder-decoder pretraining,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.864066Z"},"links":{"cited_paper":"/paper/2206.00311","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:3ed6e6387a3b385a55d6d6c61f978548684de6d83a9aa41e74677bbbc0704c2b","observation_id":"3e913a1d-5220-4e8e-86fd-8c3c80b5d31f","resolution":{"observed_at":"2026-08-12T18:51:50.864066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.777226Z","title":"Towards accurate scene text recognition with semantic reasoning networks,","venue":null,"work_id":"3cf77196-5de1-40bc-aad6-d6c77c413a8a","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.870943Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:686d3644568ab8154fec21fd7951e81d4d503f6637100bcf001f18f37670fbe0","observation_id":"fc24f0a7-bc9b-4f8e-a57c-6ed45b9eefa6","resolution":{"observed_at":"2026-08-12T18:51:52.783768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.741709Z","title":"Seed: Semantics enhanced encoder-decoder framework for scene text recognition,","venue":null,"work_id":"6285c433-f39b-4fbf-8be4-818a94dca5de","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.877425Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:531b8586360cabeb2cd0815f6e5acab6d0e2be53b841650c1dd6302b907a2449","observation_id":"964ec38a-f7e9-4439-994f-5dde280b75d9","resolution":{"observed_at":"2026-08-12T18:51:52.754387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.705659Z","title":"On vocabulary reliance in scene text recognition,","venue":null,"work_id":"58fd86a4-f5b8-421d-9cb5-1e8211f20ef7","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.885900Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:093def4adf03697b4b3ccebc1632e050b63bafb7165f3761dc493cf02dbc7536","observation_id":"a3838276-dd2e-420c-9379-821d21227ddf","resolution":{"observed_at":"2026-08-12T18:51:52.717253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.666862Z","title":"Ressl: Relational self-supervised learning with weak augmentation,","venue":null,"work_id":"9ad44254-6ecd-49a1-a34c-a579958ad514","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.892516Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:786f6f04aee7affe72912c68b3910e3c2fb8a40321fb3a192418abac4cb4fbb0","observation_id":"70b6e185-263e-4787-9fa5-a6a20773d936","resolution":{"observed_at":"2026-08-12T18:51:52.676841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.899694Z","title":"Synthetic data for text localisation in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.899694Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:3d83c30f6ac51509b2c4d08446ddb82e9804879d87c1d7ee151a332e3ddcd700","observation_id":"a0266b4a-835a-475c-959f-757b35f52242","resolution":{"observed_at":"2026-08-12T18:51:50.899694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.613780Z","title":"Rethink- ing text segmentation: A novel dataset and a text-specific refinement approach,","venue":null,"work_id":"af3730c4-519b-4518-83be-e7d3337c3ea6","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.908188Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:fcc02800c7a6d97e90393929b583e5640a0b35117b2847f3e53267a831783a1e","observation_id":"2f0c00b6-91b6-4bfd-98bc-4ef005f9cb42","resolution":{"observed_at":"2026-08-12T18:51:52.623318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.579253Z","title":"Relational contrastive learning for scene text recognition,","venue":null,"work_id":"367d193e-570d-4ccf-9c9b-715f3133c6e4","year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.914335Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:9fcc75dd436d857639ed63905f7b5bf46ba892a38e30b9ce2d3b1efbae91b0c9","observation_id":"1c9b8423-121c-463b-8ab5-362d7b5c435f","resolution":{"observed_at":"2026-08-12T18:51:52.598854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.923630Z","title":"Unsupervised learning of visual features by contrasting cluster assign- ments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.923630Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:0805f8884446105ab45f1cba9b86ce2b9c997f85afdc6bf411c391e86d712a13","observation_id":"60134332-9388-44ca-a69a-d6ea42533e25","resolution":{"observed_at":"2026-08-12T18:51:50.923630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.930894Z","title":"Bootstrap your own latent-a new approach to self-supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.930894Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:39966aa4f435bd18aa06a9c0b4123fb252f966b7da1e92794ff40fe8e5587245","observation_id":"183fe724-b5f8-4c46-a267-ca6f8f487dd6","resolution":{"observed_at":"2026-08-12T18:51:50.930894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.940508Z","title":"Exploring simple siamese representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.940508Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:69b1610f5ef2d44440daab3b55363e16f3201e17b337738c762e925e666a8b3d","observation_id":"4a006d29-137f-4795-99a6-e0c851631114","resolution":{"observed_at":"2026-08-12T18:51:50.940508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:50.945778Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.945778Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:0d8d43760c94d4af3254bb3aeb73f3449eb2a2d211e7fb12788e113c1c5ec9a3","observation_id":"27ea1a1d-6ecd-45c2-b8f2-0073a227c032","resolution":{"observed_at":"2026-08-12T18:51:50.945778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-12T18:51:50.951689Z","title":"ibot: Image bert pre-training with online tokenizer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.951689Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:7da6db4fb18369fc7e146d2fe3129a0c8e65cb935aa6cb81b551a4954eee4a47","observation_id":"b91e51fb-4ca1-4577-9ff7-223bb5a18fae","resolution":{"observed_at":"2026-08-12T18:51:50.951689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T18:51:50.962274Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.962274Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:111ea85f7264c4e13a51ebf27628197fbbe8151b2fd178d19753eb7e46b7f830","observation_id":"01b76be6-5c32-471f-a601-c6c1fe7fa17e","resolution":{"observed_at":"2026-08-12T18:51:50.962274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.463200Z","title":"Contrastive learning with stronger augmenta- tions,","venue":null,"work_id":"ad2f4471-b12c-42b5-bac4-f0abe3cc074d","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.969284Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:23fc17948b20bfa5b36f7222a18a3970f44c3694d2492b3ecdb92412fd824383","observation_id":"d26d25f2-e35c-457a-99d7-0e3c0d0c14f2","resolution":{"observed_at":"2026-08-12T18:51:52.477016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.425521Z","title":"What if we only use real datasets for scene text recognition? toward scene text recognition with fewer labels,","venue":null,"work_id":"4cb70880-cb07-4a9c-8b61-6412a647d41d","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.978025Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:485cdff00d5f34ee4296e78bd0d6edfe5b21b6e33012c35cf9cba48d8f4b3666","observation_id":"a3086599-781f-4b39-b4fd-f2ccd2f2e188","resolution":{"observed_at":"2026-08-12T18:51:52.440978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.396937Z","title":"Siman: Exploring self-supervised rep- resentation learning of scene text via similarity-aware normalization,","venue":null,"work_id":"6a9e4c07-f333-48d1-a494-2ebbe987e27e","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.987664Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:161b74eb563b0a110933a4ebd4adb5608a7ba0d57325663f7754a78b15559001","observation_id":"ddbd37fd-da62-400b-9b57-70ae7bf42747","resolution":{"observed_at":"2026-08-12T18:51:52.404622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.369556Z","title":"Self- supervised character-to-character distillation for text recognition,","venue":null,"work_id":"442369e2-cee6-43af-9cf5-15402e9d9d97","year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:50.996746Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:c4770d13ade32c9e168b1bce7aec152b0d78bed61e890602da307003d39b8099","observation_id":"93e80a5d-fbbe-4a0f-8e1d-f1c8f777b9b4","resolution":{"observed_at":"2026-08-12T18:51:52.377343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.343748Z","title":"Reading scene text in deep convolutional sequences,","venue":null,"work_id":"fc1ba461-585e-4c98-8a71-a3c62b83a193","year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.007434Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:926ea4e8f3b511c1e90ea87facd1229132a68af637e56d0f7f6f54fa1b78268f","observation_id":"b2444aa3-aacf-4583-ab26-7478617f1f99","resolution":{"observed_at":"2026-08-12T18:51:52.350919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.313665Z","title":"Accurate recognition of words in scenes without char- acter segmentation using recurrent neural network,","venue":null,"work_id":"18338c89-6cfc-4c58-bf2f-f8fae1596d4e","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.039572Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:276ac5403ec2e17f772c24bdf9c21ee66c07e4990d5c3db22f1338d5c7ea7a8e","observation_id":"70bd8651-a4a6-4636-800a-56f7253b28c1","resolution":{"observed_at":"2026-08-12T18:51:52.322809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.049965Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.049965Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:35812bd4ea9534eecced26d97a643740ef477db364f9da395e74a6964c75104b","observation_id":"b8a625bb-108a-48a2-bdbb-333c455433da","resolution":{"observed_at":"2026-08-12T18:51:51.049965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.241843Z","title":"Aster: An attentional scene text recognizer with flexible rectification,","venue":null,"work_id":"1f23a469-4a8d-4605-8659-51e0a945efb1","year":2018},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.057681Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:9ca14ca38695d54620d1bd99107353c63110513e6b5e77733b77da0555e3bad8","observation_id":"e4f90b37-65c5-4c45-bb1b-5e6f01e50b3a","resolution":{"observed_at":"2026-08-12T18:51:52.252200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.214869Z","title":"Learning to read irregular text with attention mechanisms","venue":null,"work_id":"9f998bff-444a-4d6a-97e5-598c9d07666d","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.068453Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:eb3aab0b08e016f0d73d84554938172a70ea20b294b570391e3c94342162e9aa","observation_id":"5f53a680-4315-4f3f-b2fd-9430fae75fa3","resolution":{"observed_at":"2026-08-12T18:51:52.222611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.182767Z","title":"Attention-based extraction of structured information from street view imagery,","venue":null,"work_id":"62298943-56c8-4d90-ba93-119ee59ecfd2","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.078112Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:0c74bc3deb1068fef02bb55564b32b3cb6b4bc16ef5c50b655baf742eee02306","observation_id":"d06b7ef9-7e6b-49b8-855b-4bbb1c8a0710","resolution":{"observed_at":"2026-08-12T18:51:52.190639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.893092Z","title":"On recognizing texts of arbitrary shapes with 2d self-attention,","venue":null,"work_id":"d8f0f93f-22bd-4b1a-8a0b-95cb00458b3f","year":2020},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.091409Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:f3d8ccd31daa1dda497415dbe4561f58adb3d550cfca968d09921f1606ab649a","observation_id":"68f78fcc-ae89-4967-80d1-844cb149945e","resolution":{"observed_at":"2026-08-12T18:51:52.902039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.155709Z","title":"Master: Multi-aspect non-local network for scene text recognition,","venue":null,"work_id":"79676658-c077-479d-b49c-a30355b59aca","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.099312Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:e07663e84aacba10fe4964551f2c76415e2e70ad9269c11740b382f43d9d21c8","observation_id":"55dbeeb6-2eee-4546-a882-dfbeea03c7b6","resolution":{"observed_at":"2026-08-12T18:51:52.167233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.120368Z","title":"Context-based contrastive learning for scene text recognition,","venue":null,"work_id":"00f4c5a1-b871-49cc-8909-fc1b667aa2e0","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.110585Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:d8d67b8f34fe97c0db034b1c04fab0f8d5394619acd5b1856060063ecfa54171","observation_id":"36aab0a8-24ed-44ac-b68e-46bf06759c6a","resolution":{"observed_at":"2026-08-12T18:51:52.130710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00729","last_updated":"2023-05-01T09:12:30Z","snapshot_observed_at":"2026-08-16T15:36:34.181469Z","submitted_at":"2023-05-01T09:12:30Z","title":"What Do Self-Supervised Vision Transformers Learn?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00729","snapshot_observed_at":"2026-08-12T18:51:51.115642Z","title":"What do self-supervised vision transformers learn?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.115642Z"},"links":{"cited_paper":"/paper/2305.00729","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:08d352de1ef6269a9c82b2572431c6051281decd7490a11e13d2d07a8d86bc1e","observation_id":"30d36c02-f4b6-46db-b23f-b3e5ebda92f5","resolution":{"observed_at":"2026-08-12T18:51:51.115642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07700","last_updated":"2022-06-15T17:52:23Z","snapshot_observed_at":"2026-08-16T16:52:44.815432Z","submitted_at":"2022-06-15T17:52:23Z","title":"Masked Siamese ConvNets","version":1},"cited_work":{"arxiv_id":"2206.07700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.07700","snapshot_observed_at":"2026-08-12T18:51:51.450542Z","title":"Masked Siamese ConvNets","venue":"cs.CV","work_id":"4a627bfb-72fd-4ddf-9f25-93862cdef94c","year":2022},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.131141Z"},"links":{"cited_paper":"/paper/2206.07700","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:22b59c7dcd571b295a17493e7c26af58563a7ef0bec5c1ee0977143b0be256ba","observation_id":"2c07420e-0c87-43e3-8e7a-ba146686b80e","resolution":{"observed_at":"2026-08-12T18:51:51.459743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.093099Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoen- coders,","venue":null,"work_id":"abb0001a-789c-4c86-a940-ff1c393facdb","year":2023},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.140411Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:66b43bb395712443a8ccd03f70d4b62f2bb7e5debe24e002fe077fa6ed7fe0ba","observation_id":"d946ce2f-def7-4683-b9ff-12f493d29f49","resolution":{"observed_at":"2026-08-12T18:51:52.099905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.149908Z","title":"Scene text recognition using higher order language priors,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.149908Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:6b5216746bcfaf22369626ade48136e00ab620ae4aca4570160ac65bf19d7036","observation_id":"3d00ae23-eaea-49d2-ba9d-22c07fd90ffa","resolution":{"observed_at":"2026-08-12T18:51:51.149908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.038499Z","title":"Icdar 2003 robust reading competitions: entries, results, and future directions,","venue":null,"work_id":"6b25d0f9-9919-4995-9198-2400fb6d3108","year":2003},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.158424Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:e64d2806facffe0ece2fda65acc685a64e6d92daad7960d0ecaecc0fd3bb5abf","observation_id":"daa89420-6b8a-4705-9b91-a40edd7ea10a","resolution":{"observed_at":"2026-08-12T18:51:52.050339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.165266Z","title":"Icdar 2013 robust reading competition,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.165266Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4c41e510ce8d13bd050c2a44c92d774ff1db7d44f40130e34b5fad481a13e775","observation_id":"3e6d85b9-1692-43e9-a2a4-341c139fd1cc","resolution":{"observed_at":"2026-08-12T18:51:51.165266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.171251Z","title":"End-to-end scene text recog- nition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.171251Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:fe5e41b03da6fe2cc65d5d2407c4de619a42cabd0b45f1f0693a62885eb7eccb","observation_id":"f7cfbb70-e9fa-40b3-b8fc-1a160fc60d81","resolution":{"observed_at":"2026-08-12T18:51:51.171251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.176641Z","title":"Icdar 2015 competition on robust reading,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.176641Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:f0d3f92df5c0034df06c3b3a4b8a9e9819ee9592e963a1afcf635f4b4187e400","observation_id":"d0ec2b24-e01f-451e-a75e-c357c32a4627","resolution":{"observed_at":"2026-08-12T18:51:51.176641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.181284Z","title":"Recognizing text with perspective distortion in natural scenes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.181284Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:a2dc479fb3dd2bf307757c8e02246fc1822adb548c58d999e657633b12439858","observation_id":"709297c3-c80f-4f4d-85dd-92e3c2e0324b","resolution":{"observed_at":"2026-08-12T18:51:51.181284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.189723Z","title":"A robust arbitrary text detection system for natural scene images,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.189723Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:9dae6b954450aeae3068263ba52b2bcf4f939f1c09daac98f2bf446c41851447","observation_id":"a5e9a834-5d93-4e84-a1b0-8f6ea61ef8eb","resolution":{"observed_at":"2026-08-12T18:51:51.189723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-08-14T22:13:00.450823Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-12T18:51:51.194473Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.194473Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:2edd3eae7f41bff26d071fd8cefabdf8b38698d57050d973e2f65580fd8d0c43","observation_id":"24933bd1-0dce-42e8-994c-af1d4374b14e","resolution":{"observed_at":"2026-08-12T18:51:51.194473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.914778Z","title":"Curved scene text detection via transverse and longitudinal sequence connection,","venue":null,"work_id":"190a6b48-ae57-4e40-8ea2-8a44c5e31ec5","year":2019},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.201544Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:58d36de510966dfc6517da8910c806a2fc5941e447a30cbb23bc308529825a63","observation_id":"45cc2fd2-fd34-4f99-945c-0eb27d4d8b0f","resolution":{"observed_at":"2026-08-12T18:51:51.919960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.885544Z","title":"Total-text: A comprehensive dataset for scene text detection and recognition,","venue":null,"work_id":"97dccfca-f70d-4dc1-8723-e4e1117a38b8","year":2017},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.208011Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:6d2675ebb6fc78b29259ba8f5551060322847d4446ef5ec4007e25ee610dafa5","observation_id":"5bd2736b-1dfe-4b13-9ac6-07ee9568cf60","resolution":{"observed_at":"2026-08-12T18:51:51.892724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:52.918000Z","title":"From two to one: A new scene text recognizer with visual language modeling network,","venue":null,"work_id":"fc361f42-b9ee-44d5-9d2c-4eef894baa99","year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.216055Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:c254fd7bdeb948b8f6350ec47c381c2dcbef6eba397b6561e549e4ab72826def","observation_id":"711f8c5e-dace-4049-bcfb-c1af68d97e23","resolution":{"observed_at":"2026-08-12T18:51:52.924987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.854508Z","title":"Robust scene text recognition with automatic rectification,","venue":null,"work_id":"c0334e0d-b0df-4eee-9aa2-52b5dd25ee54","year":2016},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.221565Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:d9c21d999036b792a8d1d8005c11bc31324454a01005f42ea612d6e935ae27ef","observation_id":"c48a0081-eca3-4332-ad4f-8b03272225dd","resolution":{"observed_at":"2026-08-12T18:51:51.862579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.831896Z","title":"What is wrong with scene text recognition model comparisons? dataset and model analysis,","venue":null,"work_id":"0e579d38-5e43-404c-912c-6d9b5a93ef7d","year":2019},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.226112Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:a528b303cee5e2bc47aa2181511978e9808453b815fae4c8e826e841f953c027","observation_id":"567b5ee9-14fe-446f-9024-14baf5d428e4","resolution":{"observed_at":"2026-08-12T18:51:51.838323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2227","last_updated":"2014-12-09T11:22:59Z","snapshot_observed_at":"2026-08-15T07:44:04.183185Z","submitted_at":"2014-06-09T15:53:33Z","title":"Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2227","snapshot_observed_at":"2026-08-12T18:51:51.233345Z","title":"Synthetic data and artificial neural networks for natural scene text recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.233345Z"},"links":{"cited_paper":"/paper/1406.2227","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:cad0c88b7ee03d433a970229f4292dcd533b073ef90693543224fa13461c070e","observation_id":"bb93bc87-90ea-4726-864b-ee8d92d23afd","resolution":{"observed_at":"2026-08-12T18:51:51.233345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.15093","last_updated":"2022-11-25T12:03:17Z","snapshot_observed_at":"2026-08-16T17:31:07.940615Z","submitted_at":"2021-12-30T15:30:52Z","title":"Benchmarking Chinese Text Recognition: Datasets, Baselines, and an Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.15093","snapshot_observed_at":"2026-08-12T18:51:51.239927Z","title":"Benchmarking chinese text recognition: Datasets, baselines, and an empirical study,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.239927Z"},"links":{"cited_paper":"/paper/2112.15093","citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4d9c2ab9dfdd301ef4748b66ae0d977213f9f1f545583d06c7f0d4500e8986d5","observation_id":"269c4479-5ac7-498e-a195-c818e760d4f0","resolution":{"observed_at":"2026-08-12T18:51:51.239927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.808715Z","title":"The iam-database: an english sentence database for offline handwriting recognition,","venue":null,"work_id":"c98c8a6a-85b9-4d8a-81db-f1ad98b9e61b","year":2002},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.248254Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:4c9cc3611279d622211b6451661696ce154d0b6f112a6693be9a983b7f854721","observation_id":"92f2fc5d-958a-44b0-93bd-e502b61e316d","resolution":{"observed_at":"2026-08-12T18:51:51.817737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.766274Z","title":"Cvl-database: An off-line database for writer retrieval, writer identification and word spotting,","venue":null,"work_id":"dfb7ef24-8dfe-4a3f-accd-6739a067a0f7","year":2013},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.254718Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:775188b24913d81b9f5d286298316238b7bfe9a019e689b874abd1ae8f567118","observation_id":"c6b7fa5a-4e6d-477d-8e3f-187a58c3ad9f","resolution":{"observed_at":"2026-08-12T18:51:51.783072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:51:51.260140Z","title":"Stochastic neighbor embedding,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:51:51.260140Z"},"links":{"citing_paper":"/paper/2411.11219"},"observation_digest":"sha256:c4cbfcfe5c90ad01a85de17274a1cbff7ca28e88a8cfae3fa13269353ae8294f","observation_id":"e5059467-309a-4b32-9523-a682fb31f211","resolution":{"observed_at":"2026-08-12T18:51:51.260140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11219","last_updated":"2024-11-19T12:40:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:26:54.157006Z","submitted_at":"2024-11-18T01:11:47Z","title":"Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2411.11219."}