{"as_of":"2026-08-10T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef9aff8b122f4e22e855fa6cd37715ab715ac27409af37d805bf4fa44f5e0d57","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:39:42.744296Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02200/citation-record","integrity":"/paper/2507.02200/integrity","json":"/paper/2507.02200/citation-record.json","paper":"/paper/2507.02200"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:39:35.967746Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:35.967746Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:712e95714acae49b46f0399c883d1798395399e536c4b35cd8a12253b5317026","observation_id":"7fa9976f-1977-4bce-a214-6a78e4fdb26a","resolution":{"observed_at":"2026-08-06T20:39:35.967746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:39:36.044235Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.044235Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:3429bfc63fb098171d433f79a6a9567ef710967060dd91a3802be2daa3ffcac3","observation_id":"5107c995-1937-4009-be2b-4bca8a1b6c69","resolution":{"observed_at":"2026-08-06T20:39:36.044235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T20:39:36.050654Z","title":"Deepseek llm: Scaling open-source language models with longtermism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.050654Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:8246c367d5167b82b3b6824044616bd34cf583c93cbb119f621fcf0fc62141d9","observation_id":"d7c765c3-961a-4228-a99d-1084a7fd394a","resolution":{"observed_at":"2026-08-06T20:39:36.050654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T20:39:36.056493Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.056493Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:166c8d183c6cc8f585986ba1d367c1e16e2fcb809a61ced448fe55d649e1dc42","observation_id":"69a4a4f2-1e40-4a5b-bfda-ec51446ed499","resolution":{"observed_at":"2026-08-06T20:39:36.056493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:36.060758Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.060758Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:7b8fbba8342cec530a7644e72513807da543125594998596b4ee52c828c7f3be","observation_id":"ded81192-5e4a-4fa7-a375-9ab38931b5af","resolution":{"observed_at":"2026-08-06T20:39:36.060758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:36.159865Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.159865Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b6ccf23af1f22539004dac680e81cc5f648f5617cef821ccc20b0905269e0a8b","observation_id":"d7a75d1b-8a04-4854-ac5e-06e4197a948f","resolution":{"observed_at":"2026-08-06T20:39:36.159865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:36.276623Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.276623Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:dae51f8546e5be2f2ade5c78adefa880e356330d87d7f871b546dbc84ba87abd","observation_id":"46ae1e91-5a3a-4873-acfe-4f3702a5bae5","resolution":{"observed_at":"2026-08-06T20:39:36.276623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.838717Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions,","venue":null,"work_id":"17bb0556-4a53-472a-a938-a644dde8f38e","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.391472Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:c876e3910d4c12af6af0c85a95b01a694e774924bedad91f1e0c188500c98954","observation_id":"a63c5b57-2e2b-4c12-a056-4a76c4cf19c8","resolution":{"observed_at":"2026-08-06T20:39:50.938126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08195","last_updated":"2018-07-20T17:45:14Z","snapshot_observed_at":"2026-07-06T06:10:43.541739Z","submitted_at":"2017-11-22T09:45:51Z","title":"On the Automatic Generation of Medical Imaging Reports","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08195","snapshot_observed_at":"2026-08-06T20:39:36.460302Z","title":"On the automatic generation of medical imaging reports,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.460302Z"},"links":{"cited_paper":"/paper/1711.08195","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:1b4c311d5f7d8922596b5b2a148bd53fc7cc0b2ee50761c44b491008746af4d5","observation_id":"99baa04f-ce55-447c-b321-4863963dd2ad","resolution":{"observed_at":"2026-08-06T20:39:36.460302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.593079Z","title":"Mmtn: multi- modal memory transformer network for image-report consistent medical report generation,","venue":null,"work_id":"05a77823-c606-43da-9d67-3beaf67d93e5","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.526931Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5485a5166cc78e88169a5241d56b1e2beb572a01f78aebbf231e619dc993b91c","observation_id":"3cd4a321-5884-4a88-87b1-26e048bd4ba5","resolution":{"observed_at":"2026-08-06T20:39:50.699702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.415789Z","title":"Medblip: Bootstrapping language-image pre- training from 3d medical images and texts,","venue":null,"work_id":"4077b112-d092-41d2-ba99-30d3f02216d5","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.611391Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5d58392dbdedf42a1fe5593ab4502764ca7099aac1ce7bce4c3037cce7a7bdc3","observation_id":"9d71ccbb-954c-482e-8b81-666501ec5ecf","resolution":{"observed_at":"2026-08-06T20:39:50.468712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.234927Z","title":"Cxpmrg-bench: Pre-training and benchmarking for x-ray medical report generation on chexpert plus dataset,","venue":null,"work_id":"a16ee995-119a-4375-b502-a7ca9a1e9911","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.695632Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:9766ec50072046f9e2d2a3e24dc07aefbd3d2636f35e140deb8ce5231c83dcbd","observation_id":"106f0d4d-3c0b-4633-8576-17462267029c","resolution":{"observed_at":"2026-08-06T20:39:50.312214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T20:39:36.782313Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.782313Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:446272b5eb9afc7c6c54d5a374b11f13c9d5dbe4e1c2daa341f90f6b4f12ff4e","observation_id":"cdb269cb-b2e4-4c84-8496-dac5bfbdaa65","resolution":{"observed_at":"2026-08-06T20:39:36.782313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-07T22:06:22.187482Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-06T20:39:36.874218Z","title":"Docpedia: Un- leashing the power of large multimodal model in the frequency domain for versatile document understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.874218Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:d6d5b620a723a4d925cf341031afe6ec9aed6a369add808e3522e3ef817f9e7a","observation_id":"a0c23f38-0caf-46c4-91e9-39e8418b7a07","resolution":{"observed_at":"2026-08-06T20:39:36.874218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:50.080628Z","title":"Vary: Scaling up the vision vocabulary for large vision-language model,","venue":null,"work_id":"8885a34e-3e6e-4bc7-accf-71d2de03ef42","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:36.985825Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:724c586de7e7d17966a7fda2f8634c915882700ea64b89742f61d79fa71ac94d","observation_id":"464a6115-9253-43a5-93fe-6970c3902ff7","resolution":{"observed_at":"2026-08-06T20:39:50.145467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-06T20:39:37.113140Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.113140Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:49373faa196af7d2203643f37d06fcc166d90453333991bb368d907d14a415b0","observation_id":"28ac8605-6fd0-46f2-bb60-72bcd742971a","resolution":{"observed_at":"2026-08-06T20:39:37.113140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-10T02:15:09.754142Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-08-06T20:39:37.205231Z","title":"General ocr theory: Towards ocr-2.0 via a unified end-to-end model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.205231Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:bbde970620671909a1c995e2319b06b7952b2edd6e752ef3e2f6ecc6294afda0","observation_id":"a060338a-bfa2-405d-91f5-108686d35f23","resolution":{"observed_at":"2026-08-06T20:39:37.205231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09020","last_updated":"2025-02-13T07:16:16Z","snapshot_observed_at":"2026-08-09T20:40:48.350298Z","submitted_at":"2025-02-13T07:16:16Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","version":1},"cited_work":{"arxiv_id":"2502.09020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09020","snapshot_observed_at":"2026-08-06T20:39:43.081786Z","title":"EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition","venue":"cs.CV","work_id":"ba1c4ea5-6fcd-493f-b9a5-4087792abb9c","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.290321Z"},"links":{"cited_paper":"/paper/2502.09020","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:f9b06158e4b96c7d79a93c40ca2f1b9c6eb5950b8da6d853c50cc0454d1c6c09","observation_id":"70a3a502-64d8-4460-b958-b48458241f0c","resolution":{"observed_at":"2026-08-06T20:39:43.263965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:49.748409Z","title":"Recurrent vision transformers for object detection with event cameras,","venue":null,"work_id":"0961e739-ed93-408d-85c1-92f7337e4b59","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.370022Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:eae3a8608befcd61985bca810955f8bb246a3322579502269395042310a5d0dc","observation_id":"45d74202-06e2-475b-8129-4a7ae80b28a2","resolution":{"observed_at":"2026-08-06T20:39:49.915023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:49.495293Z","title":"Spatiotemporal aggregation trans- former for object detection with neuromorphic vision sensors,","venue":null,"work_id":"41c0ddba-4f49-4923-b5f1-a00dfbb04545","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.439740Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:7e639432bf392b794a5e1a625ddddd2db5083e5a12654aa339a3bb39b4ed21ee","observation_id":"8f7053d6-5ce5-4466-8c35-efcdbe6ea73a","resolution":{"observed_at":"2026-08-06T20:39:49.606913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:37.503471Z","title":"Scene adaptive sparse transformer for event-based object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.503471Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:03030253aefb012fc6e9c844fafade5cc96b52022932f0cd12162ec6c28aab08","observation_id":"97467366-9bc3-45b7-ba2b-b61016a283d8","resolution":{"observed_at":"2026-08-06T20:39:37.503471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:49.299980Z","title":"Object detection using event camera: A moe heat conduction based detector and a new benchmark dataset,","venue":null,"work_id":"b5b8e675-a373-437a-8428-84041ef74ad3","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.585998Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:dfa4679f35dbef56df346a8ee61511e1a14bf5d7a62c88dce01fb011c63dd516","observation_id":"5f9d9a52-a7ff-4246-9554-8dfe8789bdcf","resolution":{"observed_at":"2026-08-06T20:39:49.388795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12908","last_updated":"2025-05-19T09:44:01Z","snapshot_observed_at":"2026-08-07T15:43:20.854778Z","submitted_at":"2025-05-19T09:44:01Z","title":"Dynamic Graph Induced Contour-aware Heat Conduction Network for Event-based Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12908","snapshot_observed_at":"2026-08-06T20:39:37.647234Z","title":"Dynamic graph induced contour-aware heat conduction network for event-based object detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.647234Z"},"links":{"cited_paper":"/paper/2505.12908","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5295e80eec70cf7895ee226933cf3264e7e84aa4d7a96325f83c33458abb895a","observation_id":"e8cdda75-d600-44eb-9a46-65c251444208","resolution":{"observed_at":"2026-08-06T20:39:37.647234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.928382Z","title":"Frame- event alignment and fusion network for high frame rate tracking,","venue":null,"work_id":"2ae263c6-4e3d-4b5d-988f-deb2df437919","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.712469Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:fdc2036f8a336ec5e6ca97e8de9a03af6cec2ddc1c908b3016443dda837204f5","observation_id":"550adb1e-0927-4ddc-9289-e90ff112750d","resolution":{"observed_at":"2026-08-06T20:39:49.091115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.826172Z","title":"Asynchronous tracking-by-detection on adaptive time surfaces for event-based object tracking,","venue":null,"work_id":"2ebbe3b8-1007-4b23-a963-fa3eac422b58","year":2019},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.802857Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:d460b81da61597670de9d3d8d43102d6a6023740f0631eefc1de666ce319d5f8","observation_id":"7804fd71-ddf7-4e37-800e-f6894de30ddb","resolution":{"observed_at":"2026-08-06T20:39:48.919115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.707497Z","title":"Object tracking by jointly exploiting frame and event domain,","venue":null,"work_id":"6b074905-4ff5-4b1e-bb9f-56d13b70ea0e","year":2021},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.886263Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:01d65f197751254d1caf521cafdef6f5a6370e5c7795adf406da885853008595","observation_id":"2cba4211-3b84-4bd3-92b1-9e3d498dd82f","resolution":{"observed_at":"2026-08-06T20:39:48.772480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.578690Z","title":"Event stream-based visual object tracking: A high-resolution bench- mark dataset and a novel baseline,","venue":null,"work_id":"61100ae6-4a60-47f6-a085-effb214c8d95","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:37.951195Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:a5ebfde050694c353c6843be175656c04fab325e4f1a3a2dfc10bf9498a4f5e5","observation_id":"41fac88c-c70f-4c61-8947-483ecaaeff46","resolution":{"observed_at":"2026-08-06T20:39:48.636857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T20:39:38.040843Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.040843Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:3bc55e386586f1320534ed5834c62ee29b41e9b9f3bca18f384637434e51ec20","observation_id":"0b804b5f-7b24-49f2-8317-c2d403e94ba9","resolution":{"observed_at":"2026-08-06T20:39:38.040843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T20:39:38.129720Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.129720Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:ef6195794014937d09f806e11a79f61e545fee06a3733dda8869cb064989afb3","observation_id":"77921fcc-e1aa-404d-9a39-914b8b5409f3","resolution":{"observed_at":"2026-08-06T20:39:38.129720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:38.201262Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.201262Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:aac943b365749cf24450783e2498f9c55384bd6052b17e003b2c9fefeab3beeb","observation_id":"2138f408-6212-4bae-b27a-f53b86a1b773","resolution":{"observed_at":"2026-08-06T20:39:38.201262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.425052Z","title":"Toward understand- ing wordart: Corner-guided transformer for scene text recognition,","venue":null,"work_id":"c4aa078a-47bf-4a1d-be7d-01e7f9ef85c9","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.307102Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:3704d9546de0bf16f9c1029d63dd5399757e4031f154d90914cfc5243362d69b","observation_id":"e36d2bff-e199-4082-a772-299525206509","resolution":{"observed_at":"2026-08-06T20:39:48.483904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.283756Z","title":"Icdar 2015 competition on robust reading,","venue":null,"work_id":"97cb31f9-5cf3-481e-9fd9-9781bbe962f1","year":2015},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.397542Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:f0fdd6632050fd7409fb77cf54b28842d78dd4956c90f32003ffd5ab480135bd","observation_id":"fb3583c6-146e-4fef-ac2c-068d3fa29b91","resolution":{"observed_at":"2026-08-06T20:39:48.341480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.125453Z","title":"Large-scale multi-modal pre-trained models: A comprehensive survey,","venue":null,"work_id":"fa0fb575-6463-45c6-9e51-cf1e6621fe82","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.491872Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b0b8151b60681714a05615d5b43bb319ee6bad85632f16605638cec56057e17d","observation_id":"8edd767c-a5c9-4b36-9d0f-e9945ec5bb20","resolution":{"observed_at":"2026-08-06T20:39:48.218824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:48.019820Z","title":"Towards reasoning in large language models: A survey,","venue":null,"work_id":"7554cce1-9dce-44fc-9e04-26140bac527e","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.570046Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:77fd668d32e5611ee382dcd276e70a37779786f8780b52baacaa5b03a9a249b0","observation_id":"196379df-241b-4110-b8d1-ac85355d3ec8","resolution":{"observed_at":"2026-08-06T20:39:48.065677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.918317Z","title":"Scene text detection and recognition: The deep learning era,","venue":null,"work_id":"61d28fe1-a13f-45cc-bba1-3bc6e2a726c8","year":2021},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.664732Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:2be20375f9f1f0a00a365c1f71f4b6aa6b2edb461c4ca6372d33562ca8834dd1","observation_id":"bf01319e-44c9-4475-b5e4-4ea7f06a732d","resolution":{"observed_at":"2026-08-06T20:39:47.959478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.814982Z","title":"End-to-end scene text recog- nition,","venue":null,"work_id":"f210bef9-de99-49e2-82f2-db26358c74b1","year":2011},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.796614Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:20d9df4c7b620b9859cae0dfc151f8fea52ef59bd6215b68e2a1134159df0c11","observation_id":"da666ce1-c4de-402c-8e0d-3616fd11b40d","resolution":{"observed_at":"2026-08-06T20:39:47.852463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.695464Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition,","venue":null,"work_id":"19c958d5-88b8-4708-95c6-ad1ce603b621","year":2016},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:38.902784Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5a1805a19b4378a2c71c938c5ad323a7056da703cb7514187789330d9da95c40","observation_id":"6d19681a-8604-4785-9c04-0a7b4c1f7e6f","resolution":{"observed_at":"2026-08-06T20:39:47.759833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.550914Z","title":"Scene text recognition from two-dimensional perspective,","venue":null,"work_id":"9483a1aa-e781-4fb3-aa35-e8fe392ad9c6","year":2019},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.005100Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:bb050059968ed3a4d9715fb351e62441d671ef9eb89d6985caade3222647187c","observation_id":"62f4259b-a431-4cf8-83c8-e4218970b495","resolution":{"observed_at":"2026-08-06T20:39:47.601237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.412803Z","title":"Spotlight text detector: Spotlight on candidate regions like a camera,","venue":null,"work_id":"2048e5c5-dc0f-4934-aee5-fee8f92c7196","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.134674Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:0fff791a068a0f644d88539707eaf116465264499a57381f20bc0264b1379761","observation_id":"20c20456-8da3-4b44-ad9c-fbeef2eebaa0","resolution":{"observed_at":"2026-08-06T20:39:47.497734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:47.199849Z","title":"Multi-modal in-context learning makes an ego-evolving scene text recognizer,","venue":null,"work_id":"27d5ca70-105c-4e33-adaf-f2818c5c8c09","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.272309Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:54d583568726fb45c616ee9f4a9bfa9fd38d4d4841279ddb998f6732bb9e0e89","observation_id":"ef4e2c86-136b-42ed-b4f0-4c14c740effc","resolution":{"observed_at":"2026-08-06T20:39:47.310112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.977422Z","title":"Self- supervised character-to-character distillation for text recognition,","venue":null,"work_id":"2ba041a0-16f8-4f5d-992c-a193d70c26f9","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.373243Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:ea537c23980b1f0f302a454244c9b8fc5208c3641fb44d74df20f017358792e4","observation_id":"84fcfc40-da24-4549-ba4a-26470426d56a","resolution":{"observed_at":"2026-08-06T20:39:47.103138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.754061Z","title":"Self- supervised implicit glyph attention for text recognition,","venue":null,"work_id":"755a9f99-38fa-458d-9315-ecee9fdce1f0","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.496053Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:e1b76de3225c7b86a6e67ac8af2d1487e9a466b791f6f208c48555c82f426a6c","observation_id":"af216b40-5a6e-4eae-9d72-7055bd1ca2c3","resolution":{"observed_at":"2026-08-06T20:39:46.859814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.608922Z","title":"Cdistnet: Perceiving multi-domain character distance for robust text recognition,","venue":null,"work_id":"556c2d44-fe93-4297-b79c-22546d0501ae","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.556835Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:3bf4e152f7dedbce69b98788da6aead9aec952f7a12c4c90cfe7e49b233689a9","observation_id":"5693d0ac-a012-4fb9-b99f-63431d1ff9f7","resolution":{"observed_at":"2026-08-06T20:39:46.680741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.440043Z","title":"V olter: Visual collaboration and dual-stream fusion for scene text recognition,","venue":null,"work_id":"3d585960-c6e2-4a96-926c-e998daea6d6e","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.616706Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b24b96ebbb3663aa6bdd6293e53e40bad9de32b2fe43b2b578086c018111e981","observation_id":"385fcf6a-d6ab-4a3f-bb01-1779c474a50c","resolution":{"observed_at":"2026-08-06T20:39:46.538441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.225763Z","title":"Image as a language: Revisiting scene text recognition via balanced, unified and synchronized vision-language reasoning network,","venue":null,"work_id":"7b5a0d25-5228-403f-8222-7ec60fd012aa","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.712104Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:2fdd97b54a9abfa9e13f36d54cf1af7ea087849e6f2bdf13b1159b2990dd5905","observation_id":"f008b21b-d096-4c3e-b641-6c4541103e41","resolution":{"observed_at":"2026-08-06T20:39:46.335956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:46.081895Z","title":"Multi-modal text recognition networks: Interactive enhancements between visual and semantic features,","venue":null,"work_id":"6cc49a58-0f12-4116-a6cc-ef9f217d27bd","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.788971Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:348e309715d4227c039a0aeb043430e4291c2e58b4e0020da227f8864a7e6478","observation_id":"7682d2f6-2d3b-4e26-9ebf-25df9e34d9e8","resolution":{"observed_at":"2026-08-06T20:39:46.139522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.923013Z","title":"Levenshtein ocr,","venue":null,"work_id":"5baf5260-f460-489d-b494-8d6d880f8c3c","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:39.916145Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:7368f12924c82825009b671b6e1f98de76704a18a70c5891f76c1f3453ff2213","observation_id":"4b03f2fa-8add-454b-93cb-539377e921e6","resolution":{"observed_at":"2026-08-06T20:39:46.016506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.733061Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition,","venue":null,"work_id":"1b7920ab-1bdb-4af3-a490-a1d7d97b4347","year":2021},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.044376Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:84c73efbb3b0535e56f67acf49f33aa145e3a5d50d4053240766a82c5ecc709a","observation_id":"b84bb222-b6fb-48b4-a8c8-c2a74ad3a4cb","resolution":{"observed_at":"2026-08-06T20:39:45.793509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.132801Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.132801Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:839705d1c1a58d357fd2e31c872de3f5fb5c81d49be18ddf024afe9679f74d7d","observation_id":"2e0837db-127b-4244-8fea-b8590730ab73","resolution":{"observed_at":"2026-08-06T20:39:40.132801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.228451Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.228451Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:8d48f3a366bc1fcd869d2e9fa8427d98e1dc821b82a2667d1c559f6c9e7c3103","observation_id":"0ca50e7b-9fd9-4b85-aba8-e44f03a93fd6","resolution":{"observed_at":"2026-08-06T20:39:40.228451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.310423Z","title":"Palm: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.310423Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:7a84e84ac0fb343f8be3e2214ad7343ee457a650b283484f13db386517fcc38b","observation_id":"72e3ebaf-c919-46fb-aea4-212ee8438bdf","resolution":{"observed_at":"2026-08-06T20:39:40.310423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.376174Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.376174Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:aacb1308a6ad1eff99809e3686c4447ee4af51de2bb73e63083895f32db571b7","observation_id":"5810a6b8-dd53-46bc-9000-3cc4857e785e","resolution":{"observed_at":"2026-08-06T20:39:40.376174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.486852Z","title":"Linin: Logic integrated neural inference network for explanatory visual question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.486852Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:ba013c185a50221a66cd7696c2ab14af114e478514fa56178055d4aa10bd7f74","observation_id":"a636d4c8-a326-47a0-aa97-2634dcb5ff83","resolution":{"observed_at":"2026-08-06T20:39:40.486852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.554946Z","title":"Large lan- guage models are zero-shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.554946Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5907c469cebc327fa2cc3365944afb48ccd56917b8bc887059e3bc70c8a3b2eb","observation_id":"4cc48566-8ec0-4aee-ad92-abd6467b89c9","resolution":{"observed_at":"2026-08-06T20:39:40.554946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:40.639627Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.639627Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:779ce94dae27814b2e3977ccbe4ec3eda33af665b5492733b99f1ead04877db7","observation_id":"615ad96f-fc98-43bd-a9f8-bb90c3a106f1","resolution":{"observed_at":"2026-08-06T20:39:40.639627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.511700Z","title":"Topologies of reasoning: Demystifying chains, trees, and graphs of thoughts,","venue":null,"work_id":"770e3cd2-9086-4e7f-8f7d-fe0a408b0db2","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.703978Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:56c284c49e24520736403ae0c0ce694db942a57c488dc2fb6c720b88115d5547","observation_id":"c72af958-f8e0-4fc7-89e4-3b49ae2d46ab","resolution":{"observed_at":"2026-08-06T20:39:45.584020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T20:39:40.789469Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.789469Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:68deab43d2f074592a221f163ba3b7563cf901906b6e9eb930d05856f6a5bf08","observation_id":"cb12a887-39d4-4183-8cd1-c661dd95a98f","resolution":{"observed_at":"2026-08-06T20:39:40.789469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T20:39:40.883150Z","title":"Improve vision language model chain-of-thought reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.883150Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:5a0de586d7753f0c00ddb4ed319a742c778b07b73e5b50715e3f36cb187f1ff5","observation_id":"2e373ab5-2292-4a3d-817d-38a9b1ace140","resolution":{"observed_at":"2026-08-06T20:39:40.883150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:39:40.974488Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:40.974488Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:dfa2fd00429ad2e45e41d103bda6924bedea30bcc4cf0eb048e6dc642440ed2d","observation_id":"a7d91313-ae43-4a8b-8141-7462d19a51a0","resolution":{"observed_at":"2026-08-06T20:39:40.974488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.323146Z","title":"Event- based vision: A survey,","venue":null,"work_id":"1d908ab2-7008-436c-a051-b9c4b909e774","year":2020},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.076628Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:87507e7ad4f65c32f0123b08f789190bd39ca5907c72098af2c11344e869ae84","observation_id":"2c9d24e2-8ec7-4beb-8004-6c6f42a63507","resolution":{"observed_at":"2026-08-06T20:39:45.423082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:45.134224Z","title":"Evcslr: Event-guided continuous sign language recognition and benchmark,","venue":null,"work_id":"666a3fcc-3bec-48f6-b733-e8ab813a42a9","year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.154754Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:9b79ac0341427999b28faa4d8f9204bdf6e61050da2a37224e0d3a69bac6a5cc","observation_id":"6ee778a0-9391-4e3a-b04c-7e15333e9604","resolution":{"observed_at":"2026-08-06T20:39:45.229099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.932371Z","title":"Masked autoen- coders in 3d point cloud representation learning,","venue":null,"work_id":"adcf2411-c3fa-4710-913e-0276f6632213","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.249084Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:bdc19ab185e62d0aeabb151bd341d61b79d4cd351b0dc1655dde4edad82a0520","observation_id":"fecc42b6-d763-48d2-a6e9-99b4128b4bfa","resolution":{"observed_at":"2026-08-06T20:39:45.020282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:41.320774Z","title":"Hardvs: Revisiting human activity recognition with dynamic vision sensors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.320774Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:86e75c87310a96ad09031fed220054e870b4a491ede77f5e1d61ebce73fabf33","observation_id":"65232be1-9059-4abf-9223-9e0264bfd0ee","resolution":{"observed_at":"2026-08-06T20:39:41.320774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.768871Z","title":"Semantic-aware frame-event fusion based pattern recognition via large vision–language models,","venue":null,"work_id":"045d01d8-ff0b-44fc-bc08-e34eec26d465","year":2025},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.496344Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:c794fe6c837c73c7c458f681bddf6b8efa10fdbdc88fe1d2ae1b9cdb3f3e7236","observation_id":"0bfa0891-d9e3-4c23-81d5-2ea8022f5ba3","resolution":{"observed_at":"2026-08-06T20:39:44.842282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.575746Z","title":"Scene text recognition with permuted autoregressive sequence models,","venue":null,"work_id":"9c365170-efda-43f1-aef6-c61a36e79eea","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.683677Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:2bdf50ebb2718d6c9066128fcf3de2c658917db95a5601b402045bfd98b51352","observation_id":"5eda1917-6ace-4cfa-99d0-e6f6abf1cbfb","resolution":{"observed_at":"2026-08-06T20:39:44.671540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.381510Z","title":"Multi-granularity prediction for scene text recognition,","venue":null,"work_id":"f3411acd-dec9-4919-9cec-fb27b47d9846","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.829838Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:8b5ec4872c5f1983a2ea7b0b0792261346b9096a9ed76b60f17f8dd495a00db3","observation_id":"d06b9a01-fa6d-43e0-8100-3f71f69e4a72","resolution":{"observed_at":"2026-08-06T20:39:44.466263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:44.142680Z","title":"Lister: Neighbor decoding for length-insensitive scene text recognition,","venue":null,"work_id":"4e203287-b6c7-4887-b100-d29f91221ed7","year":2023},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:41.992610Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b55e35a138d4588cc1d1f668a7a06ecd657877bf927356eace44be6f0e64df26","observation_id":"8cafcde9-ea20-43f0-ba2d-f0ff02ad0de0","resolution":{"observed_at":"2026-08-06T20:39:44.259711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:43.966345Z","title":"Reading and writing: Discriminative and generative modeling for self-supervised text recognition,","venue":null,"work_id":"8798f37d-3552-4f23-8233-2add2731bae8","year":2022},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.135929Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:0307c2de54150655e013884f6ca71f92a543f58c900f1c0c42e2d5042444d311","observation_id":"39235da8-8806-4ba1-9eb0-fd660525f0e8","resolution":{"observed_at":"2026-08-06T20:39:44.040365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:43.730535Z","title":"Esim: an open event camera simulator,","venue":null,"work_id":"a4dfa9ac-b792-4aa4-adc1-13ade7b244bc","year":2018},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.310624Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:8ee6d12ceecdac4db028348d970743de862f6a31a591956003962387909dfbc7","observation_id":"4495c532-f27d-4056-9d36-c7ecd8735462","resolution":{"observed_at":"2026-08-06T20:39:43.786942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T20:39:42.464800Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.464800Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:77c2ae7a192c2ab8979e860dd9c489a66f5a953ffff77faeff6b4adb5cf1c7b3","observation_id":"c5dd5101-020e-453a-8981-e2aeabcbc84c","resolution":{"observed_at":"2026-08-06T20:39:42.464800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2227","last_updated":"2014-12-09T11:22:59Z","snapshot_observed_at":"2026-07-06T03:45:51.255195Z","submitted_at":"2014-06-09T15:53:33Z","title":"Synthetic Data and Artificial Neural Networks for Natural Scene Text Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2227","snapshot_observed_at":"2026-08-06T20:39:42.588318Z","title":"Synthetic data and artificial neural networks for natural scene text recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.588318Z"},"links":{"cited_paper":"/paper/1406.2227","citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:b0724211d27dc047ce0f3284f07a7abdddf085cf92f8c319aba33d5cf20b7d13","observation_id":"1d742370-781c-4273-8ece-3ba08ae1bf2c","resolution":{"observed_at":"2026-08-06T20:39:42.588318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:39:43.523267Z","title":"Synthetic data for text localisation in natural images,","venue":null,"work_id":"238a512b-d0e7-41f9-8538-47ec64bb4170","year":2016},"citing_paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:39:42.744296Z"},"links":{"citing_paper":"/paper/2507.02200"},"observation_digest":"sha256:7e69a5a953d2851b082087dc2a85e976e0e208162de8051ae5bfbbcd84854d3f","observation_id":"467c50bd-27e1-4450-af13-9a226f1731d7","resolution":{"observed_at":"2026-08-06T20:39:43.633541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02200","last_updated":"2025-07-02T23:41:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T20:40:47.843153Z","submitted_at":"2025-07-02T23:41:31Z","title":"ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2507.02200."}