{"as_of":"2026-08-19T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dabfa439ec1d16a87446c049a622bb8c0c8f9c04292e066cd5d1180428fba6e","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:10:59.631543Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07161/citation-record","integrity":"/paper/2606.07161/integrity","json":"/paper/2606.07161/citation-record.json","paper":"/paper/2606.07161"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Scene text recognition for text-based traffic signs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:d7b240451d0d2c85ba7da888cad8d4e43de3369d1ce191ad8c81dbc425b17af5","observation_id":"4785c829-436c-47bf-a32c-c663e4204170","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Scene text detection and recognition: The deep learning era,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:54d4e35ddfe2f48399a14dc377830b0ec125dc65885ba7bc93a613338b159b06","observation_id":"19e53c88-7130-4d44-b649-901f53ce3217","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"End- to-end video text spotting with transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:3ba6514d2aca79996e3faceccc9f112644e0900a9cf54803727284e3d9e9044d","observation_id":"d356a016-1b7f-49c4-b354-616507edf7e1","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"GoMatching: A simple baseline for video text spotting via long and short term matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:0d06beeeec2c600b48e40c4d34b79aae496ad5e2e7c3536529487fdcfbb7c2f9","observation_id":"4c6b0cb7-1658-435b-bc86-93b695c810b0","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:07:12.903413Z","title":"arXiv preprint arXiv:2505.22228 (2025) 2, 4","venue":null,"work_id":"957db0d6-b7bc-4583-a7a6-4fc3b8088f12","year":2025},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:eb5413ac663326f4c32594b8db76c832922c2dd8dd1e25c66c024ef927fe6c2c","observation_id":"18fc7068-cbc4-4a3d-9fc8-b57e558128fc","resolution":{"observed_at":"2026-07-02T17:07:12.904890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"DeepSolo: Let transformer decoder with explicit points solo for text spotting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:8332d6507dc4c5b5b299c3762648a75c10aba2f2d75519a5dfa429db43654cfb","observation_id":"5ee2c62d-99ef-400a-b18d-477ae558001b","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Scene text recognition with permuted au- toregressive sequence models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:b5ded6df095d6e1ffa8df7d0c6c602235e54d440e729c8b347d7e741930f0754","observation_id":"875f259e-2e01-49a2-a403-68242dff3481","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"SVTR: Scene text recognition with a single visual model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:056d946b631855c7930c75ec627d260d7f398b74460a1497a5c1ec1153673b35","observation_id":"e7be6838-e052-475c-a210-2bd3e9feadb9","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"A bilingual, openworld video text dataset and end-to-end video text spotter with transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:b695015895fbc660b029b7c85f7cabd4317b07a4ab52ffda992edfe4a2a7aa0f","observation_id":"3268f207-ab95-43d9-ad66-2b4279e8498a","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"DSText V2: A comprehensive video text spotting dataset for dense and small text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:103b939e139fc83fd058148153976f9452990ff90729de51a077ee73e45a4f26","observation_id":"16a51800-4092-42c2-9585-05ead374f9b9","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"ICDAR 2015 competition on robust reading,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:62afd971a5c556e54cc67afb62125f3cb6111204e7f762659347db3653df48c2","observation_id":"09d9c7c3-2931-41e4-b4fb-49d4755050de","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Textssr: Diffusion-based data synthesis for scene text recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:7c155180eae051224a09619990588b514daf6da563399519ece19218a68c2c89","observation_id":"1daa5f3e-c123-4420-b4ff-2c29f58abdf5","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:8f899f6ac2854dee0f1888d58f85f47bc1c0fc857429a6462e3126365d20fd22","observation_id":"be95ccc1-ef56-4b27-aaa6-c0c2d5415d0e","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Q-Adapter: Visual query adapter for extracting textually-related features in video captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:96c3abb6532a32e8ec3ad7307561eb9f1198afeccdb9becf7422904b1a09a31d","observation_id":"a8030de4-c31e-436a-9411-1957279d8a41","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:33e84e19d307574a2fed744fca64705369af4e878271a70911ff9192d4106edd","observation_id":"c8c97e7d-2e14-402d-92a4-433bac2d4d02","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:2beaca9e0f354cfc083b75da2e1cd2dc1fa5ad609cc9693f146d72073baa8b30","observation_id":"f107edfe-779e-4e77-9806-90a6419db82a","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"SVIPTR: Fast and efficient scene text recognition with vision permutable extractor,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:c79471f751db22290ce679126115601ddec4aa1e6dde8f18cc457e7b4aa0f753","observation_id":"b8e48c9a-361c-457f-8ded-69a73777212d","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"DiffusionSTR: Diffusion model for scene text recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:3eaba5917a49a8163d5ce3162f5189baddf77389dfcd530dc3816f7f8d19dd1d","observation_id":"25a19c10-fb58-4c65-a31a-4097b6d5d9f2","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Mask textspotter v3: Segmentation proposal network for robust scene text spotting,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:f428f19f7e5353b12faee79f3b838282da7789b5ff6b63b075853d67b939f27a","observation_id":"073182ac-aad0-4487-ba45-7cf0960b7b64","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Swintextspotter: Scene text spotting via better synergy between text detection and text recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:357072cef2dfefbd34541c11cf70851aed4607e6c992b96f65e94262045bee2d","observation_id":"521e633b-b5c7-41d1-9297-b9a96d75ddde","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"FREE: A fast and robust end-to-end video text spotter,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:0161b851941e9eaf5df1b0918fe1ed65f68ba09e6afca5a10dc48cfaf4b03e53","observation_id":"86a69bbb-2687-49c3-a144-42872b0c8a7a","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"CLIP4STR: A simple baseline for scene text recognition with pre-trained vision-language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:754c7f13aa14c29d1728854fced9f51983122da5b3e7dd210324b11333eb55d2","observation_id":"f7f030a5-e2b9-4842-aff4-c6c65b6e0c25","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:5ecec5971b11d3b73772f60c558d2fede5ed104e121879f1c46b82f4a3da28e4","observation_id":"9a6ca382-8500-4992-8488-4b43e1926d03","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Nougat: Neural optical understanding for academic documents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:e62313b951495cc8063d500953d2259cec7ac1ba92d0212f3da10b6eb2bc8e5e","observation_id":"c138ae19-0c64-4c73-aa13-32e6bd6e211d","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":"2508.11737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-07-02T22:27:25.902699Z","title":"Ovis2.5 Technical Report","venue":"cs.CV","work_id":"83cd504b-a082-4df2-8bff-919343fc7d99","year":2025},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:3dc4e53c07d5a6aed72f76f5be4037560e0166d01cb3a0b996485954af3cdadc","observation_id":"08f752af-44da-4e78-b4bb-8cc7265f3c39","resolution":{"observed_at":"2026-07-02T17:07:12.899659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"VLMEvalKit: An open-source toolkit for evaluating large multi-modality models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:ff3727829201c6eb8d6b73f8cc8531734b51f2737122ce01e43f5be4ec5f082d","observation_id":"4ef7eeea-271d-4e37-a679-afbf42a04b77","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:7d965ecc2bdc1be51e4dcc52caf5bbe7531735cc3567ee5ed44dacb7d8546613","observation_id":"72cbb3ad-408b-4203-9a10-7943f7b91060","resolution":{"observed_at":"2026-07-02T17:07:12.897437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Patch n’ pack: Navit, a vision transformer for any aspect ratio and resolution,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:f15e87507b901973b701b19f27cce750324809e52f25360e5e328624d03847c7","observation_id":"ff32975b-cc8d-43cb-a880-8f4f527abf64","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13694","last_updated":"2025-01-23T14:19:30Z","snapshot_observed_at":"2026-08-13T08:41:25.995085Z","submitted_at":"2025-01-23T14:19:30Z","title":"Mutating ordered $\\tau$-rigid modules with applications to Nakayama algebras","version":1},"cited_work":{"arxiv_id":"2501.13694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13694","snapshot_observed_at":"2026-07-02T17:07:12.900742Z","title":"Qwen3 technical report,","venue":null,"work_id":"00e000fd-276c-4847-9a04-ad4a35351a75","year":2025},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"cited_paper":"/paper/2501.13694","citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:b8ea754243d17908c96a2f39ef79fb58e5a5108a8ff644294d7a189427cf8a0e","observation_id":"e8ff6cc0-5739-4626-a7f7-67c53bed7488","resolution":{"observed_at":"2026-07-02T17:07:12.902183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"RoadText-1K: Text detection & recognition dataset for driving videos,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:7b839a2a29f04a9b41e99da82f4c63be9f7452dd33144189c8c0240d2e67b485","observation_id":"187a44c9-ee85-4d9c-a253-6b3a3a16fcd3","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Evaluating multiple object tracking performance: the clear mot metrics,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:65efa978cf71fd288c60629b50fdcb91feb07dc2385fad1d19eb64690d7317dd","observation_id":"515c8b93-af60-4774-9868-22b7d4064f0a","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:10:59.631543Z","title":"Performance measures and a data set for multi-target, multi-camera tracking,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T22:10:59.631543Z"},"links":{"citing_paper":"/paper/2606.07161"},"observation_digest":"sha256:5b9d647dcc713b7cead964d212edc82c8e6bf54bed22e81d4e97e412ca8e4508","observation_id":"637cf813-bf5c-4a46-bd8b-9c0d1324d26c","resolution":{"observed_at":"2026-06-27T22:10:59.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07161","last_updated":"2026-06-05T11:23:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T21:50:16.916926Z","submitted_at":"2026-06-05T11:23:16Z","title":"TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2606.07161."}