{"as_of":"2026-08-10T23:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdf9eba15ecfe4798b408da3f0b4b07980709e03e65c0f9ee6be1fecffbbbc0b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:12:30.745548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:49:44.890982Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-08-08T12:12:30.745548Z","title":"Maini, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-08-08T12:06:14.483667Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:12:30.745548Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2502.07617"},"observation_digest":"sha256:0f7ebb90942fb8a68d5e6bd7633bd1654b4bbe99aa0b91d1929bb5c8fc1e25e2","observation_id":"7ab61e17-d0ee-4519-8ef5-cf6420d81bda","resolution":{"observed_at":"2026-08-08T12:12:30.745548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-08-08T06:06:17.557918Z","title":"C.; Kolter, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08211","last_updated":"2025-06-12T09:03:28Z","snapshot_observed_at":"2026-08-08T05:57:37.126588Z","submitted_at":"2025-02-12T08:40:57Z","title":"Quality over Quantity: Boosting Data Efficiency Through Ensembled Multimodal Data Curation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T06:06:17.557918Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2502.08211"},"observation_digest":"sha256:64a4010ab2079e5271018c0976510b609e1316af69a88919a58e8a1440ea1d22","observation_id":"77f46a19-d285-4d68-a19c-1866b54a68c0","resolution":{"observed_at":"2026-08-08T06:06:17.557918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":"2307.03132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-07-04T09:49:44.890982Z","title":"Lipton, J","venue":null,"work_id":"a8b4ccdf-c4f7-4c4e-a345-5eb333f39138","year":2023},"citing_paper":{"arxiv_id":"2605.22651","last_updated":"2026-05-21T15:55:15Z","snapshot_observed_at":"2026-08-04T13:23:33.803843Z","submitted_at":"2026-05-21T15:55:15Z","title":"What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:54.322211Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2605.22651"},"observation_digest":"sha256:caad04628dd951ab090da8e130e674c8e6166ae3f2e9b7ee4c48c709fc49a398","observation_id":"d9da09a4-3fe4-4be0-b30a-ed005f0366b4","resolution":{"observed_at":"2026-05-22T06:21:10.270477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":"2307.03132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-07-04T09:49:44.890982Z","title":"Lipton, J","venue":null,"work_id":"a8b4ccdf-c4f7-4c4e-a345-5eb333f39138","year":2023},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:3ff7a97af7879805f92be14fbfea54d8dba22c34f7acc2a47845d5555a56d17f","observation_id":"f069d1dc-4508-474e-b932-b754e49d125b","resolution":{"observed_at":"2026-07-04T09:49:44.892311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":"2307.03132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-07-04T09:49:44.890982Z","title":"Lipton, J","venue":null,"work_id":"a8b4ccdf-c4f7-4c4e-a345-5eb333f39138","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:1d76c823cb2aa6f9ec14735ab3ead1c95e3b99d7afc94eba40829b8cbe486598","observation_id":"82be6d52-1da5-4d4c-ba4e-2ed518577dd6","resolution":{"observed_at":"2026-07-01T15:45:47.689741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning","version":2},"cited_work":{"arxiv_id":"2307.03132","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03132","snapshot_observed_at":"2026-07-04T09:49:44.890982Z","title":"Lipton, J","venue":null,"work_id":"a8b4ccdf-c4f7-4c4e-a345-5eb333f39138","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2307.03132","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:bff1d24f76baa25482f957871df73317a844244680f79fa5ce43a9d9a37af888","observation_id":"f75d8715-046b-4d2c-9685-fdcde13bd79b","resolution":{"observed_at":"2026-07-02T21:17:23.898703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2307.03132/citation-record","integrity":"/paper/2307.03132/integrity","json":"/paper/2307.03132/citation-record.json","paper":"/paper/2307.03132"},"outbound":[],"paper":{"arxiv_id":"2307.03132","last_updated":"2024-03-18T22:18:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T03:09:09.682795Z","submitted_at":"2023-07-06T16:59:52Z","title":"T-MARS: Improving Visual Representations by Circumventing Text Feature Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2307.03132."}