{"as_of":"2026-08-09T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fb457208805ec942d0c6254f89059beecef669e5b740377c8628174f6ac497f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:14:20.565274Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:28:33.626984Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-08-09T18:14:20.565274Z","title":"Harmonizing visual text comprehension and gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00665","last_updated":"2025-02-02T04:37:25Z","snapshot_observed_at":"2026-08-09T18:06:58.908071Z","submitted_at":"2025-02-02T04:37:25Z","title":"Cross-Modal Synergies: Unveiling the Potential of Motion-Aware Fusion Networks in Handling Dynamic and Static ReID Scenarios","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T18:14:20.565274Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2502.00665"},"observation_digest":"sha256:de1f0ffbd0616ece587a185e61a92e47074ba720d546ccaaf52d584bfc4e8415","observation_id":"dc901be3-4476-4199-a428-1b7deb6edade","resolution":{"observed_at":"2026-08-09T18:14:20.565274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-08-09T15:56:19.608798Z","title":"Harmonizing visual text comprehension and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01280","last_updated":"2025-02-19T11:13:18Z","snapshot_observed_at":"2026-08-09T15:46:05.582429Z","submitted_at":"2025-02-03T11:51:24Z","title":"Trajectory Map-Matching in Urban Road Networks Based on RSS Measurements","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T15:56:19.608798Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2502.01280"},"observation_digest":"sha256:1c553d0f0948335a9748e42c7d495371ee4334afaf634e1f953418524e987e17","observation_id":"b6933a08-a366-4049-ab65-ef2d44b7e169","resolution":{"observed_at":"2026-08-09T15:56:19.608798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-08-03T10:43:50.147898Z","title":"Harmonizing visual text comprehension and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-08T18:45:43.759614Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.147898Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:930765ccaafb560142fed5cfd636d6bf3f080df37ad666e7e40194736e3a1671","observation_id":"dc036175-bea6-4c43-9376-0ddbd24b286b","resolution":{"observed_at":"2026-08-03T10:43:50.147898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-08-03T10:43:42.384131Z","title":"Harmonizing visual text comprehension and gen- eration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-07T05:38:49.409741Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.384131Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:d56998a84746b9bc8e2ae9728fc1dd0d9b0d0ffbe6b89c7f74b9fd5f15a8ad58","observation_id":"8ed3d896-8766-48e1-9674-a86e86f64363","resolution":{"observed_at":"2026-08-03T10:43:42.384131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2407.16364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-07-03T15:28:33.626984Z","title":"Harmonizing visual text comprehension and generation","venue":null,"work_id":"207ee6d8-b7ed-4414-ba15-af5638c2b5fc","year":2024},"citing_paper":{"arxiv_id":"2604.03339","last_updated":"2026-04-03T07:59:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T07:59:26Z","title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T20:01:57.029143Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2604.03339"},"observation_digest":"sha256:64ba657a154d35ae07ced95e4c5dd87787eec31fde674f7980646d09a9b8e54a","observation_id":"8cf78f22-553e-429b-874e-f1ba5abe3f97","resolution":{"observed_at":"2026-05-13T20:03:12.267004Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2407.16364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-07-03T15:28:33.626984Z","title":"Harmonizing visual text comprehension and generation","venue":null,"work_id":"207ee6d8-b7ed-4414-ba15-af5638c2b5fc","year":2024},"citing_paper":{"arxiv_id":"2605.18173","last_updated":"2026-05-18T10:15:57Z","snapshot_observed_at":"2026-08-02T16:11:51.976692Z","submitted_at":"2026-05-18T10:15:57Z","title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T11:28:51.711892Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2605.18173"},"observation_digest":"sha256:3f14c1d4b687f10158855d99508e4c5839d19e8f31e1c9c5bf9067975beca256","observation_id":"8a857f10-18f3-4a33-ae58-4daae806a8a4","resolution":{"observed_at":"2026-05-20T11:33:14.553159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2407.16364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-07-03T15:28:33.626984Z","title":"Harmonizing visual text comprehension and generation","venue":null,"work_id":"207ee6d8-b7ed-4414-ba15-af5638c2b5fc","year":2024},"citing_paper":{"arxiv_id":"2606.30189","last_updated":"2026-06-29T12:04:01Z","snapshot_observed_at":"2026-08-08T12:01:02.445654Z","submitted_at":"2026-06-29T12:04:01Z","title":"DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:20.803078Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2606.30189"},"observation_digest":"sha256:39e01f6d2c8fb9c54f80e08a9b651b0181f1d54fa195be9a4fa9320f52516c37","observation_id":"7bffe56b-0eb1-40e6-83c2-751a95d3766a","resolution":{"observed_at":"2026-06-30T06:04:21.431043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation","version":2},"cited_work":{"arxiv_id":"2407.16364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.16364","snapshot_observed_at":"2026-07-03T15:28:33.626984Z","title":"Harmonizing visual text comprehension and generation","venue":null,"work_id":"207ee6d8-b7ed-4414-ba15-af5638c2b5fc","year":2024},"citing_paper":{"arxiv_id":"2607.01602","last_updated":"2026-07-02T02:04:07Z","snapshot_observed_at":"2026-08-02T11:44:30.389009Z","submitted_at":"2026-07-02T02:04:07Z","title":"ProWAFT: A ROMA-LPD Instance for Workload-Aware and Dynamic Fault Tolerance in FPGA-Based CNN Accelerators","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T15:23:48.748933Z"},"links":{"cited_paper":"/paper/2407.16364","citing_paper":"/paper/2607.01602"},"observation_digest":"sha256:70d3da9f03bc5551d0066e36fa4ad8ca714a56244cb51d1dfa4f0bfe6c0fb732","observation_id":"9fab5b0b-3626-41ed-872c-2a5ff25a4f14","resolution":{"observed_at":"2026-07-03T15:28:33.628647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.16364/citation-record","integrity":"/paper/2407.16364/integrity","json":"/paper/2407.16364/citation-record.json","paper":"/paper/2407.16364"},"outbound":[],"paper":{"arxiv_id":"2407.16364","last_updated":"2024-10-23T08:27:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:50:35.863605Z","submitted_at":"2024-07-23T10:11:56Z","title":"Harmonizing Visual Text Comprehension and Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2407.16364."}