{"as_of":"2026-08-09T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9dd720dc67017615c3df5ec7abbc815d9e7af43954abe9dabb0f3c6eab99369","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:57:16.959836Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:39:37.290321Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T20:39:43.081786Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"cited_work":{"arxiv_id":"2502.09020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09020","snapshot_observed_at":"2026-08-06T20:39:43.081786Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","venue":"cs.CV","work_id":"ba1c4ea5-6fcd-493f-b9a5-4087792abb9c","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-08T11:36:51.992565Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.290321Z"},"links":{"cited_paper":"/paper/2502.09020","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:56b8874e969514a59b7f919ee9d9c8fdf64e8b335c0f21da42cb958c34151793","observation_id":"70a3a502-64d8-4460-b958-b48458241f0c","resolution":{"observed_at":"2026-08-06T20:39:43.263965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09020/citation-record","integrity":"/paper/2502.09020/integrity","json":"/paper/2502.09020/citation-record.json","paper":"/paper/2502.09020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.792319Z","title":"Scene text recognition with permuted autoregressive sequence models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.792319Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:950bec3385f14fabb145532fa56f240fd944697bd57049b71c4dc4d18062fef9","observation_id":"e4ea8a5d-0e9c-43de-93d6-e014eefafee0","resolution":{"observed_at":"2026-08-07T22:57:16.792319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.796295Z","title":"Multi-granularity prediction for scene text recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.796295Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:70cd47fb9f7adf8fcac94e24675f64026169a6cf51ebc1385b3280ba05660600","observation_id":"28a0b444-3b6b-44ab-96c1-bbae88105755","resolution":{"observed_at":"2026-08-07T22:57:16.796295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-07T22:57:16.799161Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.799161Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:818591f850514700fa43711b1e7448681a8cc7b3c9362ae1904e0f5a10ff907a","observation_id":"a5d3e400-8976-49bc-9b90-6504d8b2b832","resolution":{"observed_at":"2026-08-07T22:57:16.799161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-07T22:57:16.802643Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.802643Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:1588c9491b989792466a02c388eca1bb2e9504d65ff770c630cce5f7d2a23f57","observation_id":"bf198aa3-25a7-412e-8c04-b444fc36d215","resolution":{"observed_at":"2026-08-07T22:57:16.802643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-07T22:06:22.187482Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-07T22:57:16.806336Z","title":"Docpedia: Un- leashing the power of large multimodal model in the frequency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.806336Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:62fb979718ce7a706880a6da28e87d8e566b0855d528577651bb339915bb5f3a","observation_id":"1b59d5e2-d19b-4111-b093-d28a829d7925","resolution":{"observed_at":"2026-08-07T22:57:16.806336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.386706Z","title":"Asynchronous spatio-temporal memory network for continuous event-based object detection,","venue":null,"work_id":"e047e6e0-ee96-47e4-84fd-9a6546fb8158","year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.809726Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:11293b8ca5e2094874a611c300d6c930ced3f854db3ba05ca4d0564e6b9960f2","observation_id":"364acf43-fc84-4a7e-b3f2-f92f6a748da5","resolution":{"observed_at":"2026-08-07T22:57:17.390136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.813145Z","title":"Event stream-based visual object tracking: A high-resolution bench- mark dataset and a novel baseline,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.813145Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:a1acd4d04ff3868f3b9b1007e8385cd72f6863643c0b1d527e9b18931027868f","observation_id":"38b8f488-dca2-418f-87ba-9addbfe2eb11","resolution":{"observed_at":"2026-08-07T22:57:16.813145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10487","last_updated":"2024-08-20T02:01:17Z","snapshot_observed_at":"2026-08-08T09:50:57.105894Z","submitted_at":"2024-08-20T02:01:17Z","title":"MambaEVT: Event Stream based Visual Object Tracking using State Space Model","version":1},"cited_work":{"arxiv_id":"2408.10487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10487","snapshot_observed_at":"2026-08-07T22:57:17.051760Z","title":"MambaEVT: Event Stream based Visual Object Tracking using State Space Model","venue":"cs.CV","work_id":"4d3437c3-9882-443c-b2e5-c13e63479e01","year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.816319Z"},"links":{"cited_paper":"/paper/2408.10487","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:52510dc81329f40cb00cef7921e799209cece2a824d802e790db9ceb773d1c52","observation_id":"ed3653ba-ae27-429e-add8-40abfa73bdbf","resolution":{"observed_at":"2026-08-07T22:57:17.057304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.819606Z","title":"Semantic-aware frame-event fusion based pattern recognition via large vision–language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.819606Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:bfab7ea9195d96e1fe3ef57268259cb9cd7ebfbc2da4e00c553be934da0950a3","observation_id":"c02ed2b0-c268-442c-bcc4-5164f8b51b02","resolution":{"observed_at":"2026-08-07T22:57:16.819606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.822475Z","title":"Hardvs: Revisiting human activity recognition with dynamic vision sensors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.822475Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:8e052768aa32ec76a827719a5d4a5be24404c5c0c9c95ef066b6cbc04c5e8ada","observation_id":"4de58393-1fa5-4b7e-85cb-49935984271c","resolution":{"observed_at":"2026-08-07T22:57:16.822475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.359924Z","title":"Event-based semantic segmentation with posterior attention,","venue":null,"work_id":"168d9bd2-83bf-43f7-8552-b673963704cd","year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.825431Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:4fd4b3e33e97aba0d6be542a3fc545cb8c97683fbb3f315af6fb2c9fb2059c91","observation_id":"bdb7617f-3fea-4b59-8c34-4e07854ba5a8","resolution":{"observed_at":"2026-08-07T22:57:17.362943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.828376Z","title":"Scene text detection and recognition: The deep learning era,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.828376Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:fef829955426b883c13149021eaca8cdffab1e4aa20b4e4985ba688353f8c82c","observation_id":"9b03ed33-f337-422e-af2f-c31a4692a836","resolution":{"observed_at":"2026-08-07T22:57:16.828376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.831601Z","title":"Large-scale multi-modal pre-trained models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.831601Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:4ca415d1388e155121dbfff9c5be025a5348233e992c6762a9bc1a66baa92992","observation_id":"412739b3-92fb-48b0-b435-8db0eae72655","resolution":{"observed_at":"2026-08-07T22:57:16.831601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.840273Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.840273Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:0e5969de05a85476a4cfe162b08c8dc205ec5a03bd3d5b734c3bd72b04f9c96e","observation_id":"a258fc1e-aa56-478f-9d28-48756a721c06","resolution":{"observed_at":"2026-08-07T22:57:16.840273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.843021Z","title":"Scene text recognition from two-dimensional perspective,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.843021Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:03e7540f508dfa181120ab0912e5b0be5ccc9986e4073aefd266875098d62d5c","observation_id":"0dd974e4-2cb4-458d-84fe-1a56f362d96b","resolution":{"observed_at":"2026-08-07T22:57:16.843021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.846107Z","title":"Spotlight text detector: Spotlight on candidate regions like a camera,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.846107Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:b2c4e14c9f95d668ac97a6971f0596021ce90c76aaaaea474940469b24f8e029","observation_id":"9069d8e3-14b5-490c-9f84-0b394641d7f8","resolution":{"observed_at":"2026-08-07T22:57:16.846107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.849066Z","title":"Multi-modal in-context learning makes an ego-evolving scene text recognizer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.849066Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:41078acfe27db162bced19bd51c84d21212fcd803f6f2537a695a86985b3faea","observation_id":"1ff0d50b-3063-4c5f-983a-8f9ee686813d","resolution":{"observed_at":"2026-08-07T22:57:16.849066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.852085Z","title":"Self- supervised character-to-character distillation for text recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.852085Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:455ec4640b5257e3330f5b227d34ff6b44571570460641dd25bce79a92c7afc6","observation_id":"fdce7d03-09b2-474b-8953-4e8bcfc13ede","resolution":{"observed_at":"2026-08-07T22:57:16.852085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.855034Z","title":"Self- supervised implicit glyph attention for text recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.855034Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:7b184bcb33619cc0f6a0baf3a7f469d6b84d6096e3a6a473af32c1715f6db830","observation_id":"3cecdf4c-50c7-40b5-bd08-749f92ae624d","resolution":{"observed_at":"2026-08-07T22:57:16.855034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.858010Z","title":"Cdistnet: Perceiving multi-domain character distance for robust text recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.858010Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:ca5ee9d3d6457f5d606b47d6a75cb74f9338ac94057b1f0a75e9ea66deb5a7d2","observation_id":"841d6345-2659-47ca-ada0-7937d3a8f718","resolution":{"observed_at":"2026-08-07T22:57:16.858010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.861001Z","title":"V olter: Visual collaboration and dual-stream fusion for scene text recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.861001Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:31a728eda296805a5b7997f14e9b562e7374097b50f94aa3c26853203e583545","observation_id":"3e84f7eb-a2ab-48f3-ae4c-8a47d5d2605d","resolution":{"observed_at":"2026-08-07T22:57:16.861001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.284034Z","title":"Image as a language: Revisiting scene text recognition via IEEE TRANSACTIONS ON ***, 2025 12 balanced, unified and synchronized vision-language reasoning network,","venue":null,"work_id":"eab2715f-5274-465f-bcf9-31612d907844","year":2025},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.863931Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:3301439d230086657a30dad2792b5298e250bbac61428b1cc201988a8d2adb8f","observation_id":"b19b7fc6-b870-434c-baf9-615c9c9e15a1","resolution":{"observed_at":"2026-08-07T22:57:17.287141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.866750Z","title":"Multi-modal text recognition networks: Interactive enhancements between visual and semantic features,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.866750Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:498bf357c6847bbb5e2fb129d2e0a9226a937fe699408b4debcb87012738c6bd","observation_id":"13d33ccb-3dde-4d73-9ac9-176993495f02","resolution":{"observed_at":"2026-08-07T22:57:16.866750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.869685Z","title":"Levenshtein ocr,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.869685Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:b6cf8cfde52cdbd8b0c50ba529c74746cbde50f81a2e14415d70b39fa4529483","observation_id":"d9ff65de-e9fa-4497-a085-9a7c013dc985","resolution":{"observed_at":"2026-08-07T22:57:16.869685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.872614Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.872614Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:288af3ff47ff4542277ff5a5ad09a1237372df2f8452c4fc9248d9b4c574c5f9","observation_id":"6b0c944a-02b7-46ba-a081-00cc962939ed","resolution":{"observed_at":"2026-08-07T22:57:16.872614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T22:57:16.875539Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.875539Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:7cb8175f67b204b8a6efb29502839a6881a8fed68b80fc72ea76a1083086b2e0","observation_id":"23f9a554-2557-42d3-8cb3-182c72868f8f","resolution":{"observed_at":"2026-08-07T22:57:16.875539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.878738Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.878738Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:a9df5ac248781227565049ecef2db5064e01b5f7901fa489e7a1b948e776095b","observation_id":"d8c1ddfe-7260-4691-8b8c-ba8b16283e1e","resolution":{"observed_at":"2026-08-07T22:57:16.878738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-08T22:58:25.892839Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-07T22:57:16.881380Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.881380Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:35abb083a036d2d2be39fc27c7c7c6062f1c462a31f49f6f3c8382f22029d6d3","observation_id":"7711f7ff-4629-48e4-bd52-a996a0bba7eb","resolution":{"observed_at":"2026-08-07T22:57:16.881380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.884455Z","title":"Event- based vision: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.884455Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:ca8c14582231242050f57c5d40ac5f2820a7cdf7d230076642182f31266da2be","observation_id":"9a945b49-0147-4def-9418-6a2e6982f98e","resolution":{"observed_at":"2026-08-07T22:57:16.884455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.887491Z","title":"Evcslr: Event-guided continuous sign language recognition and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.887491Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:89e536ca97f9fdd9eff1166891930dd97b81f1ab056f84c95dd43a7419292c34","observation_id":"d063e2c7-bc26-4fb5-a0da-1eee53bb53eb","resolution":{"observed_at":"2026-08-07T22:57:16.887491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.890269Z","title":"Recurrent vision transformers for object detection with event cameras,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.890269Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:7d6090377c8d44750163ee12f7e1cb3854038ec097c0698687ec610c4dd1ad6b","observation_id":"f12e7000-b812-43c8-800f-394078315b95","resolution":{"observed_at":"2026-08-07T22:57:16.890269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.892764Z","title":"Masked autoen- coders in 3d point cloud representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.892764Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:3acce39193222233aceaed3461d77c0065e5ee21c5319d000cf3932a1233b6a2","observation_id":"49c53830-5319-46ce-8def-4fa316085b15","resolution":{"observed_at":"2026-08-07T22:57:16.892764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T22:57:16.895662Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.895662Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:b362407b7138c4c7417dd5c94fb5b7b2d779a0be41ea226740f5fca181f9d820","observation_id":"859b3fd2-8cb3-4451-b9d0-b4c7c06bc49b","resolution":{"observed_at":"2026-08-07T22:57:16.895662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T22:57:16.898339Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.898339Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:abd26155335cbb79119d99c85164027e2d171ff0aa200a0a895d9dee5e35760d","observation_id":"0cc4c1b0-8c30-4b89-8cd8-01a22b97910a","resolution":{"observed_at":"2026-08-07T22:57:16.898339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2227","last_updated":"2014-12-09T11:22:59Z","snapshot_observed_at":"2026-07-06T03:45:51.255195Z","submitted_at":"2014-06-09T15:53:33Z","title":"Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2227","snapshot_observed_at":"2026-08-07T22:57:16.901715Z","title":"Synthetic data and artificial neural networks for natural scene text recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.901715Z"},"links":{"cited_paper":"/paper/1406.2227","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:87ddb5cf4bea15c1b383e907862e12c2491c7af1f6804188e274944fa02ae8b3","observation_id":"784191bc-1af4-47a8-a36f-513897e39c7d","resolution":{"observed_at":"2026-08-07T22:57:16.901715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.904522Z","title":"Synthetic data for text localisation in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.904522Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:8d370e72a2612ab2848d1ea6fd2bc38a0d144bd110c560467a478cb70edba5d0","observation_id":"dca6a317-d6e7-456c-9a31-5564c7e101fa","resolution":{"observed_at":"2026-08-07T22:57:16.904522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.907075Z","title":"End-to-end scene text recog- nition,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.907075Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:665d796c1d1968a9f92cbdbd50b22c6dd73d217497d73ecb6c6108dfb52145cd","observation_id":"608b45fc-a4bd-4474-876d-97419f7261a7","resolution":{"observed_at":"2026-08-07T22:57:16.907075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.230675Z","title":"Scene text recognition using higher order language priors,","venue":null,"work_id":"cb7256a0-156d-4e39-9981-b5c21145de10","year":2012},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.909440Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:70fa39366fc88de7011340c45903e4bebc9e67470c0c2d21e78f9d6fc449a5f2","observation_id":"5175f72b-d2ee-4260-820e-38cdd4ee3ccc","resolution":{"observed_at":"2026-08-07T22:57:17.233755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.221897Z","title":"Icdar 2013 robust reading competition,","venue":null,"work_id":"306935d5-aecb-4de8-8ad6-4ea5482dc202","year":2013},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.911879Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:7a36655abd118e41711741b0d28ef43966d6585e2e5b473634a9883987605724","observation_id":"48b400f8-6963-4334-8954-9be6477081a3","resolution":{"observed_at":"2026-08-07T22:57:17.224800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.213085Z","title":"Recognizing text with perspective distortion in natural scenes,","venue":null,"work_id":"603f4731-168b-4c45-ba38-f476dc33028f","year":2013},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.914269Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:7f683131ea4ef3479b2ca1b29093069611192468b17f5989f669bad48f5764c4","observation_id":"3649c659-7ea5-4a0a-9b0b-ccb111833c36","resolution":{"observed_at":"2026-08-07T22:57:17.216317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.203905Z","title":"A robust arbitrary text detection system for natural scene images,","venue":null,"work_id":"9d53f1bc-03ee-45a1-8d96-70e6ccea119a","year":2014},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.916561Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:a3e9ded11a6038082281dd32c3cd687fa5eb2a2f6973128c0e306c7b9846c60f","observation_id":"360b4552-301c-4fca-ab78-6a40c7aad437","resolution":{"observed_at":"2026-08-07T22:57:17.207239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.918962Z","title":"Icdar 2015 competition on robust reading,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.918962Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:97b7be96e23e590d8ae61e74fa04962e5224b98a595f5a53c29008176ab382c7","observation_id":"0369e321-937b-4384-9674-26273f9348d0","resolution":{"observed_at":"2026-08-07T22:57:16.918962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T22:57:16.921697Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.921697Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:20d8dcebc747ca26771dab2e707010e63dfd761457bfcc591764c73818124fd6","observation_id":"c2bee00b-2479-4b81-8f29-80d6f61f1acb","resolution":{"observed_at":"2026-08-07T22:57:16.921697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.189082Z","title":"Icdar2017 competition on reading chinese text in the wild (rctw- 17),","venue":null,"work_id":"fceba776-8b09-4707-8fea-d50248d4cd6b","year":2017},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.924525Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:b4ee234d18191e3813cb0a35ac7719d103717950d4cf299bc190992cecb72086","observation_id":"3489985e-0114-4a2d-8681-19401907e298","resolution":{"observed_at":"2026-08-07T22:57:17.192263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.180095Z","title":"Uber-text: A large-scale dataset for optical character recognition from street-level imagery,","venue":null,"work_id":"2a9ac340-b9fb-4ea3-8fc4-4f7621a65b3d","year":2017},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.927122Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:2af140b25913e883fca01956b63e837d9a6d5696ad99d8068e25b7e23e677593","observation_id":"3349dbee-1e83-43ee-852a-b8a857ab256a","resolution":{"observed_at":"2026-08-07T22:57:17.183433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.171657Z","title":"Icdar2019 robust reading challenge on arbitrary- shaped text-rrc-art,","venue":null,"work_id":"10329ebc-41b8-4503-be25-cd01559b768b","year":2019},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.929783Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:d6558a1cf191594a9d7ad11f808de840858ec1ab49823f1ad52fa3280f22d064","observation_id":"b0af1434-1298-43d5-8e52-23bdfe64a408","resolution":{"observed_at":"2026-08-07T22:57:17.174389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.162853Z","title":"Icdar 2019 robust reading challenge on reading chinese text on signboard,","venue":null,"work_id":"84723a10-00dd-4be4-a7d3-48bb47644d3e","year":2019},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.932462Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:567f7dfc30e11807cb6e2dea0736b96d2f6ab7472363542dbba5457f6b30a42c","observation_id":"69605e56-b6e5-4141-8b7d-c3d27fd01bb6","resolution":{"observed_at":"2026-08-07T22:57:17.166010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.153504Z","title":"Icdar 2019 competition on large-scale street view text with partial labeling-rrc-lsvt,","venue":null,"work_id":"13ee3115-e57e-4344-86b8-54902b0810fd","year":2019},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.935258Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:ae0ca8c20c4b8db87b23803339568ba5cc5d18e82fc5cf479cda5b0226b88bd8","observation_id":"090536e4-71e1-4d7b-9e27-d38838529741","resolution":{"observed_at":"2026-08-07T22:57:17.156593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.143839Z","title":"Icdar2019 robust reading challenge on multi-lingual scene text detection and recognition—rrc- mlt-2019,","venue":null,"work_id":"91342176-4ec5-4a47-ab78-a33c45c11f5c","year":2019},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.938080Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:8ac87f9f686c742ef764c11752210ccdf830d4d91e874b684203c45ef59ac3b5","observation_id":"ef7056d3-4443-4582-8699-9e934143cbdc","resolution":{"observed_at":"2026-08-07T22:57:17.146925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.134133Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text,","venue":null,"work_id":"5d43b6f0-bce6-4cce-9ddd-cbf2c3f6ebd7","year":2021},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.940683Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:9dfadf1b74afc6a024ce355d5ad122e7e002ad34b2256100b9ec25b6b339054e","observation_id":"e8197730-f94f-44a6-96b6-7e9f46216606","resolution":{"observed_at":"2026-08-07T22:57:17.137952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.943560Z","title":"Toward understand- ing wordart: Corner-guided transformer for scene text recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.943560Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:da321254c06f3c700de634b2536433738647532a0371e8ac474a3e77416d243d","observation_id":"077b6e41-d5e0-4dbe-b6ef-f5a8383e3c39","resolution":{"observed_at":"2026-08-07T22:57:16.943560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.118442Z","title":"Revisiting scene text recognition: A data perspective,","venue":null,"work_id":"f08f049c-2764-4f36-a176-64c9298d3c6e","year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.946183Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:b57dd75ae311688fe6791a8d80232a47ad066b8d65e456972c68c71494888766","observation_id":"8c90957d-62ec-4832-8c3f-aadeda5f592d","resolution":{"observed_at":"2026-08-07T22:57:17.121911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.948950Z","title":"Lister: Neighbor decoding for length-insensitive scene text recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.948950Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:638488aca43bbe5aea02278d104d919b7a6f30ac5944da5359dea7b49eb093b6","observation_id":"99df8ff3-e59d-4756-ab48-40fef68e89e5","resolution":{"observed_at":"2026-08-07T22:57:16.948950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:17.101740Z","title":"Reading and writing: Discriminative and generative modeling for self-supervised text recognition,","venue":null,"work_id":"d964ef11-e439-4e05-b397-84ad7968037b","year":2022},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.951599Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:18274546b6708d76ea305869bf8b7b8d771bb97bc9dd78c5bda7deb65334a2c2","observation_id":"e1278b59-1595-469b-b899-e9314125fc01","resolution":{"observed_at":"2026-08-07T22:57:17.105107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.954174Z","title":"Esim: an open event camera simulator,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.954174Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:086c373548cac5febf475d830a60f5ffe56d4f65e578818c39d3f5b292a515ed","observation_id":"0dd0833c-75c9-42b5-b882-41c24812882b","resolution":{"observed_at":"2026-08-07T22:57:16.954174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T22:57:16.956940Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.956940Z"},"links":{"citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:0e6826108ee15d2e39a9c2db1abe23d95485b50422965f44a8026879dfc73bcc","observation_id":"7d738682-9ec7-414e-8541-1615b13bd257","resolution":{"observed_at":"2026-08-07T22:57:16.956940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T22:57:16.959836Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T22:57:16.959836Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.09020"},"observation_digest":"sha256:2200714c8efc09e2486d4de8797f74f5583c4312cff267ddaeee995f45bcb4c7","observation_id":"c1b1a1db-9dbb-43db-8d07-16b3cfebabf3","resolution":{"observed_at":"2026-08-07T22:57:16.959836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:50:26.994027Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2502.09020."}