{"as_of":"2026-08-10T08:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b0d7016e3460354f409e8eb84c77c37ca4eb1c2571973f2c9d4dcdbd699b601","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:26:34.931761Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.01390/citation-record","integrity":"/paper/2511.01390/integrity","json":"/paper/2511.01390/citation-record.json","paper":"/paper/2511.01390"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.11740","last_updated":"2020-07-17T22:19:59Z","snapshot_observed_at":"2026-08-09T19:02:25.484253Z","submitted_at":"2019-09-25T20:02:54Z","title":"UNITER: UNiversal Image-TExt Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11740","snapshot_observed_at":"2026-08-04T00:26:34.881258Z","title":"Uniter: Learning universal image-text representations.arXiv preprint arXiv:1909.11740,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.881258Z"},"links":{"cited_paper":"/paper/1909.11740","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:ac8139a0a252eedb996e83d88aa26cfb557c0f27fd4ccf113da18a2fadc23185","observation_id":"13e18712-028d-4062-86a6-8106ca9f484a","resolution":{"observed_at":"2026-08-04T00:26:34.881258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T00:26:34.890073Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.890073Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:b14e8baf9757d663433c1cca051f57bde45996cccd2ade87f28c3ca5c2318d16","observation_id":"e8e8c1f8-b211-4a09-9b66-1dcaaccc404e","resolution":{"observed_at":"2026-08-04T00:26:34.890073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T00:26:34.907274Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.907274Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:4a4d408788ba9bd34bb803d97fd384e82b9503b6f96f419e45e901e257b78cf1","observation_id":"ef988689-8f4a-486f-b352-e90a489da990","resolution":{"observed_at":"2026-08-04T00:26:34.907274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.915761Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.915761Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:a64754c1537e5dd26ff6a7ab80a293551e8f53a5597dcfcd3416b89480e594ae","observation_id":"9ba09913-986d-473a-bb3a-c946c2025e09","resolution":{"observed_at":"2026-08-04T00:26:34.915761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.927587Z","title":"Table 4: The comparisons of image-text retrieval for SEPS-Vit and SEPS-Swin with different selec- tion ratioρon Flicker30K","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.927587Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:6fa185eeb56122cb717502568fc986e0b1e55767bb280875fbac7018a7db0183","observation_id":"e41aaab0-26be-4162-815c-c83f2c3eb5ed","resolution":{"observed_at":"2026-08-04T00:26:34.927587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.931761Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.931761Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:ef5f3a2792f4fb4ca8b4e37f770fc0edcf8c1c957b5ae6468f88ad4e40d3e6b6","observation_id":"4e09f437-9490-4a72-a487-2cda4586577e","resolution":{"observed_at":"2026-08-04T00:26:34.931761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.898696Z","title":"Image-question-answer synergistic network for visual dialog","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.898696Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:d90ec749b9b7ecae58f4f57fc07c708127da023503a5ce8cad29d1280d275f76","observation_id":"56fa954e-cab7-4085-88b5-3f7fa5188f2f","resolution":{"observed_at":"2026-08-04T00:26:34.898696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.00712","last_updated":"2017-03-05T16:59:44Z","snapshot_observed_at":"2026-08-05T03:48:52.905768Z","submitted_at":"2016-11-02T18:25:40Z","title":"The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.00712","snapshot_observed_at":"2026-08-04T00:26:34.911429Z","title":"The concrete distribution: A continuous relaxation of discrete random variables.arXiv preprint arXiv:1611.00712,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.911429Z"},"links":{"cited_paper":"/paper/1611.00712","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:b4c0f89d97370217ff0548143c5510aaf08815b18f59d45029710f744d2de94d","observation_id":"627a55b4-1432-4506-bed7-97b5580d9b60","resolution":{"observed_at":"2026-08-04T00:26:34.911429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-07-06T05:51:36.145913Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-04T00:26:34.894136Z","title":"Vse++: Improving visual- semantic embeddings with hard negatives.arXiv preprint arXiv:1707.05612,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.894136Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:0bfd2ea0beb94db04863168d5233a72814eac8746cf10f063066159005da6608","observation_id":"14faa27c-3a61-4dfa-9a5c-93b367c8ba76","resolution":{"observed_at":"2026-08-04T00:26:34.894136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.886208Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.886208Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:8d88f107dba6d668a34e63fe6a8ebdb37146ee009026868a11a7d0e069f50f46","observation_id":"b6643d60-1288-4c2e-b079-7bd486bcfd1f","resolution":{"observed_at":"2026-08-04T00:26:34.886208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.919618Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.919618Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:97c56c685df636b353464d8437c6846c172d533963e3ae3dcec6f9a5f413b9fa","observation_id":"4fa0c16c-36bd-49c5-9b8b-91f1bd5ba792","resolution":{"observed_at":"2026-08-04T00:26:34.919618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14953","last_updated":"2025-07-17T13:40:04Z","snapshot_observed_at":"2026-08-07T16:52:55.334035Z","submitted_at":"2025-03-19T07:42:24Z","title":"Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14953","snapshot_observed_at":"2026-08-04T00:26:34.902867Z","title":"Novel cross- dimensional coarse-fine-grained complementary network for image-text matching.PeerJ Com- puter Science, 11:e2725, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.902867Z"},"links":{"cited_paper":"/paper/2503.14953","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:a7977f38bb46f34ecbe67acdebbbd00e3a243298356e69933f82498cf6c6249e","observation_id":"2cd20453-59c6-4e10-af28-860e8b47f367","resolution":{"observed_at":"2026-08-04T00:26:34.902867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.923686Z","title":"In stark contrast, SEPS not only significantly surpasses all prior fine-grained methods but also successfully bridges this performance gap","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.923686Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:33b3303b47702f80a23c893d625f2df2570d8696cbafcaf65a39efa98dbdd714","observation_id":"1efe51f5-7dbe-4d7b-9141-9e9ba65ec5e8","resolution":{"observed_at":"2026-08-04T00:26:34.923686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:02:38.432842Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2511.01390."}