{"as_of":"2026-08-14T13:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cb417535d992865a774ea59f5f50d4cd3c47469426c7a20b60415b99bb28cb7","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:07.332466Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T05:51:29.406876Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:09:44.501635Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17267","snapshot_observed_at":"2026-08-05T05:51:29.406876Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04876","last_updated":"2025-09-05T07:44:05Z","snapshot_observed_at":"2026-08-08T08:36:54.691116Z","submitted_at":"2025-09-05T07:44:05Z","title":"OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaboration","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T05:51:29.406876Z"},"links":{"cited_paper":"/paper/2506.17267","citing_paper":"/paper/2509.04876"},"observation_digest":"sha256:f8be23d2036ae61b469786957f23d714431e0cd2833202f89a20fd0ed92b19b3","observation_id":"ed3a27c0-7fbc-410e-b5e1-f1305cb5945a","resolution":{"observed_at":"2026-08-05T05:51:29.406876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17267","snapshot_observed_at":"2026-08-02T22:14:31.005765Z","title":"Cf-vlm: Counterfactual vision-language fine-tuning.arXiv preprint arXiv:2506.17267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-11T12:44:14.562608Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:31.005765Z"},"links":{"cited_paper":"/paper/2506.17267","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:bf780facc7197aadb41ebad78e34e9df711e36b6c99a2bbba49a0f9ef6d716ba","observation_id":"f99d24fa-3e34-4deb-bb1e-d630323c6d50","resolution":{"observed_at":"2026-08-02T22:14:31.005765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"cited_work":{"arxiv_id":"2506.17267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17267","snapshot_observed_at":"2026-07-04T10:09:44.501635Z","title":"Cf- vlm: Counterfactual vision-language fine-tuning.arXiv preprint arXiv:2506.17267,","venue":null,"work_id":"7143ca0c-68b2-4e6c-a544-36f3fab277b3","year":null},"citing_paper":{"arxiv_id":"2606.23206","last_updated":"2026-06-22T11:51:51Z","snapshot_observed_at":"2026-08-12T12:41:30.832472Z","submitted_at":"2026-06-22T11:51:51Z","title":"CFPO: Counterfactual Policy Optimization for Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:09.716984Z"},"links":{"cited_paper":"/paper/2506.17267","citing_paper":"/paper/2606.23206"},"observation_digest":"sha256:8ddb661100e903736fbff4cd86d13191cce419990f334575e8b5e3d4024a5f4f","observation_id":"e43294dc-c047-41b0-97e7-665272a05f21","resolution":{"observed_at":"2026-07-04T10:09:44.503204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17267","snapshot_observed_at":"2026-08-02T03:20:41.148082Z","title":"arXiv preprint arXiv:2506.17267 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13931","last_updated":"2026-07-15T15:13:02Z","snapshot_observed_at":"2026-08-14T05:06:28.820576Z","submitted_at":"2026-07-15T15:13:02Z","title":"SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T03:20:41.148082Z"},"links":{"cited_paper":"/paper/2506.17267","citing_paper":"/paper/2607.13931"},"observation_digest":"sha256:cb837cbf9391bbf46ae2cf0ee684ad8289d5ffecd60a83d2a6d03356fa0a856b","observation_id":"03766e84-061f-41f4-9881-13016b986e34","resolution":{"observed_at":"2026-08-02T03:20:41.148082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17267/citation-record","integrity":"/paper/2506.17267/integrity","json":"/paper/2506.17267/citation-record.json","paper":"/paper/2506.17267"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T05:01:06.943940Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.943940Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:26146a2e36bf58faed33e455f58294f5472cd37cddae9fc514da4571b44e14ab","observation_id":"db04e06f-f11b-45e7-a857-2b6f14e0b7e2","resolution":{"observed_at":"2026-08-07T05:01:06.943940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-13T16:38:29.058109Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-07T05:01:06.949603Z","title":"A survey of vision-language pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.949603Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:75881b0fec9966a757ee62703c8ad91498c59e095cced0cac6dce6d440c60306","observation_id":"dfbd2932-fb48-49b2-b13d-92c274c9d958","resolution":{"observed_at":"2026-08-07T05:01:06.949603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:06.954808Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.954808Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:c65450ef5955d3084dd5b6c4b3816dab73efe8b1f67da675e407eeb8697e7899","observation_id":"37109915-1310-47d6-9543-ff27ed9b2992","resolution":{"observed_at":"2026-08-07T05:01:06.954808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09822","last_updated":"2025-02-09T06:59:47Z","snapshot_observed_at":"2026-08-12T22:44:32.475439Z","submitted_at":"2024-09-15T18:43:11Z","title":"Causal Inference with Large Language Model: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09822","snapshot_observed_at":"2026-08-07T05:01:06.959963Z","title":"Causal inference with large language model: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.959963Z"},"links":{"cited_paper":"/paper/2409.09822","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:8b64d67d2240c092c4c760fa2652bf2a91ab50a7def32ef6dbb06ac0801d2f0d","observation_id":"fcc8c1a0-c985-4ed2-b869-d631b3815a97","resolution":{"observed_at":"2026-08-07T05:01:06.959963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19131","last_updated":"2024-06-27T12:34:52Z","snapshot_observed_at":"2026-08-12T23:33:42.281548Z","submitted_at":"2024-06-27T12:34:52Z","title":"CELLO: Causal Evaluation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19131","snapshot_observed_at":"2026-08-07T05:01:06.966031Z","title":"Cello: Causal evaluation of large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.966031Z"},"links":{"cited_paper":"/paper/2406.19131","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:524a93ae2ff638c5c487229c29ba1dbf40430f7f2d444efb2e864550612259b4","observation_id":"60fea556-4575-45ff-9b62-2d850b2a616b","resolution":{"observed_at":"2026-08-07T05:01:06.966031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T05:01:06.971026Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.971026Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:c329ae786b122c2bd0067ea056d61ae30ceb317510fdb5b8a3d54c9d4f1ef25c","observation_id":"99555b6c-afd1-4d6d-8953-d6324ebaf0e1","resolution":{"observed_at":"2026-08-07T05:01:06.971026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:09.008418Z","title":"Measuring progress in fine-grained vision-and-language understanding,","venue":null,"work_id":"daac9b23-9d56-486a-be17-cb90c4c4ecca","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.977108Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:77a548ce4c8b8f5304daa9ae7c45092a21cdc36b796cdf081f9e5ab76a0d46ff","observation_id":"8ff0d1b4-07be-48bd-ae98-24a0b4f88ee3","resolution":{"observed_at":"2026-08-07T05:01:09.057731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.978042Z","title":"Synthesize, diagnose, and optimize: Towards fine-grained vision-language understanding,","venue":null,"work_id":"784fecd8-9726-4cf6-ad2b-a2626e3403f9","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.981847Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:48051c3934ed6f050d71d7cc72794926c4767153a4f851dcbebe03909ffec1a4","observation_id":"8300da25-7d91-4df9-abed-eaece9b8617e","resolution":{"observed_at":"2026-08-07T05:01:08.985378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.959903Z","title":"Finer: Investigating and enhancing fine-grained visual concept recognition in large vision language models,","venue":null,"work_id":"3af3f3d0-b6ea-4c86-86a2-78e39b6f63f0","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.986025Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:6555d419989338f226c19df59e506ae662c033425e44a146f2bcd787986ac90e","observation_id":"e3947761-44ac-4821-adb9-1a20a4b3d0b9","resolution":{"observed_at":"2026-08-07T05:01:08.966532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.942495Z","title":"Benchmarking zero-shot recognition with vision-language models: Challenges on granularity and specificity,","venue":null,"work_id":"fa33ea56-e557-4c56-889e-0ff58403ed07","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.990755Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:28db58b6c61662c62f3e9c9329fd8787b7a97aea142c79b62c6b4d0402edef34","observation_id":"7d2999e9-fa44-4ff1-b40a-137410a2ded7","resolution":{"observed_at":"2026-08-07T05:01:08.947634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.926000Z","title":"Vilta: Enhancing vision-language pre-training through textual augmentation,","venue":null,"work_id":"06074cea-906c-4e38-91f0-ba88eae9745c","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.995224Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:0f36a4082c0aaae3ad797c7bb5a5495382a23cff385e98274e5da96c3b1fe501","observation_id":"ab451ce1-26b1-4cb7-81d3-32137ef45aaa","resolution":{"observed_at":"2026-08-07T05:01:08.931918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.907440Z","title":"Towards vision-language mechanistic interpretability: A causal tracing tool for blip,","venue":null,"work_id":"c0a04087-1391-4c33-b5ff-13514e30433c","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:06.999305Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:dc691b933917e691ea211b129b26feaea4dd4b1d335cda635d083d7b6d38cd9f","observation_id":"b637aff9-66da-4a03-bcb8-bc90540662f9","resolution":{"observed_at":"2026-08-07T05:01:08.914022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.890507Z","title":"What matters when building vision-language models?","venue":null,"work_id":"716f8588-0d6e-4f3f-a0c9-4a8a84f4792d","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.003354Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:9e68d16f0108952ee757268792ed123ce10c048272a3d888b35837aec5e7f426","observation_id":"a1d558dd-dfec-4602-8c5c-0d506ba8ad8f","resolution":{"observed_at":"2026-08-07T05:01:08.895947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.873238Z","title":"Fine-grained alignment for cross-modal recipe retrieval,","venue":null,"work_id":"a737367a-1663-4bcc-89c6-cbadb1d41c98","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.013604Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:99e1a8b064d86c483093dfbfdd9e1d347a7a57257b77be62df22c423da837749","observation_id":"b9f42f80-8a62-4c16-b903-fd65508ef49a","resolution":{"observed_at":"2026-08-07T05:01:08.878291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.852714Z","title":"Localized triplet loss for fine-grained fashion image retrieval,","venue":null,"work_id":"c2bef25f-3df8-445c-9651-33a1c44714e2","year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.018556Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:165ef1e88352bf442eba8a8c03cf300bc83a49cf5a94ac1c917bb01735c3f2ad","observation_id":"0c8a2ede-f477-4e9f-bc3e-ac43428afc04","resolution":{"observed_at":"2026-08-07T05:01:08.858955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02545","last_updated":"2024-11-04T19:24:59Z","snapshot_observed_at":"2026-08-12T22:07:53.566183Z","submitted_at":"2024-11-04T19:24:59Z","title":"TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives","version":1},"cited_work":{"arxiv_id":"2411.02545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02545","snapshot_observed_at":"2026-08-07T05:01:08.067999Z","title":"TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives","venue":"cs.CV","work_id":"a23c4434-bf0e-4ea7-af4a-d796b9a5c221","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.023061Z"},"links":{"cited_paper":"/paper/2411.02545","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:e7c12a1f7ecbd92ae3b8bd631a3aa67d9176fe683206f19686cf1258400e7462","observation_id":"110a4311-512f-4704-9fe0-b9aaca3441f3","resolution":{"observed_at":"2026-08-07T05:01:08.073739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:07.028168Z","title":"Facenet: A unified embedding for face recognition and clustering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.028168Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:99228c8881e2aca4cc2a98b128282bc0ae4cf18b02ace9c1225986f788732eb4","observation_id":"3c99b13f-56ef-4af6-9ab3-ca42fbd4ccb9","resolution":{"observed_at":"2026-08-07T05:01:07.028168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.820731Z","title":"CPL: Counterfactual prompt learning for vision and language models,","venue":null,"work_id":"c0d9e766-afa9-4c3e-99fc-5e095a70d308","year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.037577Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:df6ad2da7819b1cf63b0e6ab6a50308d235773dacf839bae32c98069ee64f426","observation_id":"8bbcaeb3-aba4-445b-8ba4-599906698382","resolution":{"observed_at":"2026-08-07T05:01:08.825807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T05:01:07.046597Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.046597Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:cddc60facd6eff4f3d0fa5b01d553e9d76de904d67e60b35554cd2724095ee5b","observation_id":"f2cdb927-37fb-41da-80bd-bbd97f3162c2","resolution":{"observed_at":"2026-08-07T05:01:07.046597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:07.051054Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.051054Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:49894d5d32d2f5e4e32d581e94e67fd3f3479b35dcf8a0ad3072d180283963a5","observation_id":"b666d97b-07a6-4e8f-afd5-494e7f79f3db","resolution":{"observed_at":"2026-08-07T05:01:07.051054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.803409Z","title":"A survey of visual transformers,","venue":null,"work_id":"3bd4c30c-554e-4359-bbeb-caf95c5eca06","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.055484Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:7a79678a1df49501201319c7b5a94fac21872ef193f96c1f9519e23f197c59d0","observation_id":"ba152358-f5c9-440e-9f5e-efe7a008b601","resolution":{"observed_at":"2026-08-07T05:01:08.808874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:07.059548Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.059548Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:a4cf76272a5c5667a8c24243f4cab926de98f4a3e544febc21c2b26e2caee0b7","observation_id":"846e6f77-4295-47f2-ba90-0ee581c751d9","resolution":{"observed_at":"2026-08-07T05:01:07.059548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.776705Z","title":"Understanding contrastive representation learning through alignment and uniformity on the hypersphere,","venue":null,"work_id":"6499642f-f4ee-4fa4-8d7c-84460d3451a4","year":2020},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.064955Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:d861d0da5632a5cf0aca1593f7bf85e166248c4713cea4f688a5607573c2ebd2","observation_id":"e4f02ba1-a538-42dd-8408-84b1e0268399","resolution":{"observed_at":"2026-08-07T05:01:08.781994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-13T20:15:51.556270Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-07T05:01:07.069602Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.069602Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:ad0b7c79d9a9d77fb6ae02a903281dc40c8fbdec4f3d7b587cb0d0a1be45d6ee","observation_id":"02c019f0-7f4e-4b7e-b6b5-d13924477716","resolution":{"observed_at":"2026-08-07T05:01:07.069602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.759037Z","title":"Cogs: A compositional generalization challenge based on semantic interpretation,","venue":null,"work_id":"7265ed21-e266-4fbc-9b45-037a15cf523e","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.074611Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:43856a2e6970375a790fae64ea695866f02653ff77cf472003dddda94faeb68c","observation_id":"3b9e9e6a-efdb-4d44-a706-1028d67ab742","resolution":{"observed_at":"2026-08-07T05:01:08.764968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58607-2_34","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Learning what makes a difference from counterfactual examples and gradient supervision,","venue":"Lecture notes in computer science","work_id":"9d4c4447-f326-4c4b-ae5b-08b6f628e189","year":2020},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.085658Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:cd9e210e4196a927604f05b686041683305126e533151c48b61d2727becba571","observation_id":"43a53351-d77c-4251-b4fd-cea102c36b13","resolution":{"observed_at":"2026-08-07T05:01:07.374921Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.742727Z","title":"Teaching clip to count to ten,","venue":null,"work_id":"e6e26ffe-bf9b-474f-9888-f5c846176bdc","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.090433Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:589c6150fddfff4d36fa6e7ec571f4c32d1cf0ae5f9013d82ec2f00107e10434","observation_id":"08b38393-f8f0-44a3-b187-ce2bd65a3274","resolution":{"observed_at":"2026-08-07T05:01:08.748372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10534","last_updated":"2023-06-05T19:16:25Z","snapshot_observed_at":"2026-08-13T13:17:51.674017Z","submitted_at":"2022-12-20T18:46:08Z","title":"DISCO: Distilling Counterfactuals with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10534","snapshot_observed_at":"2026-08-07T05:01:07.094854Z","title":"Disco: Distilling counterfactuals with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.094854Z"},"links":{"cited_paper":"/paper/2212.10534","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:50f8f67ee8b65aa167891c7f9c90c88427f8200db9afb5638c956a7171ccf541","observation_id":"e06c7165-c2c9-4efa-b367-550c11e41768","resolution":{"observed_at":"2026-08-07T05:01:07.094854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:07.100956Z","title":"Counterfactually measuring and eliminating social bias in vision-language pre-training models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.100956Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:6fcceb501b64d07a5596794aecee19a3be4ff146ed8414bb655aaf9b3e9ad44d","observation_id":"2bad5841-e5b9-4482-a9f0-64aaf70d9a71","resolution":{"observed_at":"2026-08-07T05:01:07.100956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.837611Z","title":"Counterfactual attention learning for fine-grained visual categorization and re-identification,","venue":null,"work_id":"81c7be5e-80e4-4610-b4f8-89e442f52f13","year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.105617Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:64fe2ef8b13363684e48643a2a9428c6cb05409fad574259abd15fb1dd2bdce5","observation_id":"e09ab765-4ce8-4e63-9431-0f3250b93549","resolution":{"observed_at":"2026-08-07T05:01:08.842305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.723909Z","title":"Counterfactual samples synthesizing and training for robust visual question answering,","venue":null,"work_id":"33ca4ee0-be41-413e-b688-2a6fbf7d572b","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.110453Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:90f82be09e38d9db0cb2520650ab2331bb918f445c70472fa3c5bcbcc08eee8c","observation_id":"af420799-f337-4ec0-b5f4-19b03960bb1c","resolution":{"observed_at":"2026-08-07T05:01:08.730534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:01:07.114672Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.114672Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:0ae6122877a99185488fe0b37e88cd23db184623da9515e848ba1d78d15d8a0b","observation_id":"5733a09a-3318-489a-98d1-376fb7498080","resolution":{"observed_at":"2026-08-07T05:01:07.114672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.704184Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts,","venue":null,"work_id":"949d38b0-93c8-4be9-a91e-13aba1bac983","year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.119470Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:70acf68259d546f54befeeae2e7fa0e7849293550e3695de7e5382b5fb5c8b88","observation_id":"f4593c00-6d8a-4f6d-aa1d-a6a6c4f83ef0","resolution":{"observed_at":"2026-08-07T05:01:08.711237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.686323Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":"a8022258-1f31-4f3e-93bb-b99c909a829c","year":2018},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.123742Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:e98cc73acedf2c906ebf1aa9fde4ddf01d0bb44879eea8cf96fc4a6d7e79c559","observation_id":"fda6020a-f7a7-4d80-8212-4c0c609522ea","resolution":{"observed_at":"2026-08-07T05:01:08.692774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T05:01:07.128034Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.128034Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:bdfc8145b41091d09f7101987a5a4acb8e9d417a18a2ba073f9af227fec19139","observation_id":"060bdcea-5d8c-4cec-9572-47b5edeed4be","resolution":{"observed_at":"2026-08-07T05:01:07.128034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08164","last_updated":"2024-11-13T00:15:20Z","snapshot_observed_at":"2026-08-12T23:44:37.287660Z","submitted_at":"2024-06-12T12:54:27Z","title":"ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08164","snapshot_observed_at":"2026-08-07T05:01:07.132424Z","title":"Conme: Rethinking evaluation of compositional reasoning for modern vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.132424Z"},"links":{"cited_paper":"/paper/2406.08164","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:356153b85d652001fd3bbfccabdbd401995413740b8a70c921153028656104be","observation_id":"efa34ba6-5906-48d1-9a18-de51b7693da2","resolution":{"observed_at":"2026-08-07T05:01:07.132424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.669774Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","venue":null,"work_id":"b476ef19-b4f2-4675-84e0-137d89b6505e","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.136591Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:5d6dc0004f31fd438fa21ed44d8630e3748c71c6fb545be79e0ec7f4cd3fb91c","observation_id":"866c9125-f995-4dfe-bd87-feb0efc052a2","resolution":{"observed_at":"2026-08-07T05:01:08.674987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-13T15:12:54.655014Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-07T05:01:07.140504Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.140504Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:da1bb98f609207197e95a2d959be71c352b45cb5b30d82bba6fccd2b386fbfd9","observation_id":"e0bd20ed-6479-47b0-bb65-0026b8d5f9d2","resolution":{"observed_at":"2026-08-07T05:01:07.140504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.652793Z","title":"ImageNet Large Scale Visual Recognition Challenge,","venue":null,"work_id":"0c58875b-2412-4a88-99b8-3b21a5bc5d70","year":2015},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.145231Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:75b22d166a1f6581e56da727b305ad0685e70113d758b617254677dfb0608d4a","observation_id":"f12b6b44-3b06-4d04-a7a4-ca0e8df4fa74","resolution":{"observed_at":"2026-08-07T05:01:08.657970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.635406Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":"4081c091-bed1-453c-8b2e-3ba4454c7af8","year":2014},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.149485Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:b637ac95d4524e8ca3f93975b66ba6d9432d4d86d7d27ee9ca906d78695b631a","observation_id":"799bc5f2-8288-4427-b732-aea50db657ef","resolution":{"observed_at":"2026-08-07T05:01:08.640639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08832","last_updated":"2024-04-25T15:24:11Z","snapshot_observed_at":"2026-08-13T11:17:03.093437Z","submitted_at":"2023-06-15T03:26:28Z","title":"Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding","version":4},"cited_work":{"arxiv_id":"2306.08832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.08832","snapshot_observed_at":"2026-08-07T05:01:07.736458Z","title":"Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding","venue":"cs.CV","work_id":"4fa684c9-46dd-4f6e-8dc5-05dd04609e86","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.153634Z"},"links":{"cited_paper":"/paper/2306.08832","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:85955646176f769b9f5cd18470ab814bde27c9be8d0e4d28eaf384890f37eb39","observation_id":"ed03be52-36d3-4416-990c-4cafb667f01d","resolution":{"observed_at":"2026-08-07T05:01:07.741382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06152","last_updated":"2023-12-13T04:21:23Z","snapshot_observed_at":"2026-08-13T11:48:10.680189Z","submitted_at":"2023-05-06T03:57:05Z","title":"Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal Structured Representations","version":3},"cited_work":{"arxiv_id":"2305.06152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.06152","snapshot_observed_at":"2026-08-07T05:01:07.692865Z","title":"Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal Structured Representations","venue":"cs.CL","work_id":"afd953a2-1c7a-472e-a939-4157f1747607","year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.163971Z"},"links":{"cited_paper":"/paper/2305.06152","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:39376422ac4fb48e0f1e62b03d5b31ca0d4f94540e7a6ea8a0a53258ba57570b","observation_id":"c6d5e468-171b-47c6-a514-c88c7e26d27c","resolution":{"observed_at":"2026-08-07T05:01:07.697666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T05:01:07.168343Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.168343Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:63c7d1aef75c4c6d235d3b7b31a5797feef792801c9074f4dfc765858b3282d9","observation_id":"036de79c-a746-4d6b-8d94-91e7d50d6c8f","resolution":{"observed_at":"2026-08-07T05:01:07.168343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T05:01:07.173286Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.173286Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:127f7048a9df97d60b49029441a7d28b160da9903b0f732b8abc78fbfe741db8","observation_id":"556d253d-ee8b-4367-bd2b-bd573994ec36","resolution":{"observed_at":"2026-08-07T05:01:07.173286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T05:01:07.178097Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.178097Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:967530ee66dd327057406813760f9ac7b117b5963293b678d2c94f92a7dab4c0","observation_id":"a3d19d3a-9461-4759-90de-978b5b273bc3","resolution":{"observed_at":"2026-08-07T05:01:07.178097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T05:01:07.182593Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.182593Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:b35ee025a9785df33818166078a15e60beb10859b25572af960157cd69ffac7d","observation_id":"3838e51a-9024-44e9-8b6c-4840d6b2b301","resolution":{"observed_at":"2026-08-07T05:01:07.182593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T05:01:07.187178Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.187178Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:b33d193e67a26ce738b6c2442f1664f0c8f4551190ceac7ed8d6814ad1d2c174","observation_id":"4d6eedb6-ee1e-4ec7-a636-f31252676b0a","resolution":{"observed_at":"2026-08-07T05:01:07.187178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T05:01:07.191460Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.191460Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:48559d4c030e8fb889a5aa99ed347487a1c60b91ba9ee960e02f2745d0fc1b6a","observation_id":"8903ba8e-e6da-43b9-b714-2c24b5ee9f14","resolution":{"observed_at":"2026-08-07T05:01:07.191460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07356","last_updated":"2022-05-03T21:31:58Z","snapshot_observed_at":"2026-08-13T16:01:58.621049Z","submitted_at":"2022-04-15T07:33:06Z","title":"Vision-and-Language Pretrained Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07356","snapshot_observed_at":"2026-08-07T05:01:07.195795Z","title":"Vision-and-language pretrained models: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.195795Z"},"links":{"cited_paper":"/paper/2204.07356","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:791299948b5ded5f9a0e902c059e447429a8d1d40a467e9ff9e49d5470ae4fc7","observation_id":"ce3d1c0b-f348-4bdc-a973-23c90907feb9","resolution":{"observed_at":"2026-08-07T05:01:07.195795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:07.200219Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future directions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.200219Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:2e8fed9f2bc183b8d2fdd6b6fe9cc39c96c2a2f39af890164ea7f384562d66b6","observation_id":"6f46b262-c841-40b7-afca-bda312bc53a6","resolution":{"observed_at":"2026-08-07T05:01:07.200219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:07.204431Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.204431Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:832ada27d51ac41da565caf1c11dd19923d937034520dc52622cb0ed03be202b","observation_id":"04362e3a-ca1b-4aa9-b3c2-5162f4df9c23","resolution":{"observed_at":"2026-08-07T05:01:07.204431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.608314Z","title":"Counterfactual vision and language learning,","venue":null,"work_id":"9cba8469-f13a-496f-849a-5a370515f23e","year":2020},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.208880Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:ae96fa6b9005104c7d78df92db8a4359c3fa7338f0a520cf28e376116009da25","observation_id":"1064166d-50a6-44ac-a19e-7dead8da82db","resolution":{"observed_at":"2026-08-07T05:01:08.613419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.591417Z","title":"Counterfactual reasoning for multi-label image classification via patching-based training,","venue":null,"work_id":"81596448-d388-47b8-818c-39dae1449a8d","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.213460Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:671be84898abfd55235f96441fb436ca3b10543489dd19930ae9a06719ff4ed6","observation_id":"5256965e-acca-49f2-83fb-b036e5e749f4","resolution":{"observed_at":"2026-08-07T05:01:08.597922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09353","last_updated":"2025-04-15T10:14:34Z","snapshot_observed_at":"2026-08-12T10:51:41.369589Z","submitted_at":"2024-12-12T15:22:03Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","version":2},"cited_work":{"arxiv_id":"2412.09353","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09353","snapshot_observed_at":"2026-08-07T05:01:07.714487Z","title":"Causal Graphical Models for Vision-Language Compositional Understanding","venue":"cs.CV","work_id":"8a8dc35e-50da-48dc-9b52-31dd04031b3b","year":2024},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.218215Z"},"links":{"cited_paper":"/paper/2412.09353","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:b442beec4fb3cfdc6d8c0bfb032c7b5d9fb123f85f43d42314f8b343cda7acfd","observation_id":"75ad03d2-c6ca-4845-a852-39b0a661e028","resolution":{"observed_at":"2026-08-07T05:01:07.719377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10362","last_updated":"2022-11-05T03:51:49Z","snapshot_observed_at":"2026-08-13T14:02:14.624754Z","submitted_at":"2022-10-19T08:06:39Z","title":"CPL: Counterfactual Prompt Learning for Vision and Language Models","version":3},"cited_work":{"arxiv_id":"2210.10362","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.10362","snapshot_observed_at":"2026-08-07T05:01:07.427570Z","title":"CPL: Counterfactual Prompt Learning for Vision and Language Models","venue":"cs.CV","work_id":"508f7cd9-1e54-46f9-b4ec-cee06f7625eb","year":2022},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.222289Z"},"links":{"cited_paper":"/paper/2210.10362","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:443c743ef700ea7b7ffea5947daa5551691b4c31234d1263e3f17b13899ff33c","observation_id":"f4e29da0-3367-43e2-b371-50cbf99390a1","resolution":{"observed_at":"2026-08-07T05:01:07.433090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07451","last_updated":"2019-06-11T16:49:55Z","snapshot_observed_at":"2026-07-06T07:46:20.506285Z","submitted_at":"2019-04-16T04:16:11Z","title":"Counterfactual Visual Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.07451","snapshot_observed_at":"2026-08-07T05:01:07.227257Z","title":"Counterfactual visual explanations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.227257Z"},"links":{"cited_paper":"/paper/1904.07451","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:ba8ba32f088c90266b0389c0657ccacea84f576d0ed94f9397d358b9d3f83482","observation_id":"82b5f82b-87b4-4f61-8a8e-38e472eac53b","resolution":{"observed_at":"2026-08-07T05:01:07.227257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08728","last_updated":"2021-10-26T12:52:43Z","snapshot_observed_at":"2026-08-14T08:15:42.266875Z","submitted_at":"2021-08-19T14:53:40Z","title":"Counterfactual Attention Learning for Fine-Grained Visual Categorization and Re-identification","version":2},"cited_work":{"arxiv_id":"2108.08728","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.08728","snapshot_observed_at":"2026-08-07T05:01:07.405622Z","title":"Counterfactual Attention Learning for Fine-Grained Visual Categorization and Re-identification","venue":"cs.CV","work_id":"67a25eef-512f-4632-b7cd-62ee7f93bf7a","year":2021},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.231457Z"},"links":{"cited_paper":"/paper/2108.08728","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:d645c6c88c127b9bd48a9c54a30484806bf3a7198424e0e707d7ffa2410c0bf9","observation_id":"8e4108df-7b85-443d-af3d-3ff07f794393","resolution":{"observed_at":"2026-08-07T05:01:07.410653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.575948Z","title":null,"venue":null,"work_id":"f88daae4-609d-4ba6-85ae-b07c6e2be3ca","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.236954Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:413fe6b3a59cc86354e9a38e344fed12f3ef59a10a64403adf650a0676ecbe7f","observation_id":"af0ade69-265d-4dfe-87f4-5bac436fca09","resolution":{"observed_at":"2026-08-07T05:01:08.580872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.560115Z","title":null,"venue":null,"work_id":"4da0d72f-11c7-4cd9-a211-2bb3716aac46","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.241166Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:b050f57ea6accd51fd4ec42a3b7b15cefb04ae6aa64dea197c712d2515973372","observation_id":"38178384-683d-4c49-b0d8-2d9434e28870","resolution":{"observed_at":"2026-08-07T05:01:08.565173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.541528Z","title":"Rules: • Modifyonly one thing(either one attribute or one causal link)","venue":null,"work_id":"cc3f9ed4-5fd6-4dc2-9fee-8b05b584ea19","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.245312Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:85137c6fca28958c6a5d23c0ec3f6b297c439870de4cc4f119b037a71fe416c1","observation_id":"b4b2c7b5-42f4-4330-97b6-da6084a79ff5","resolution":{"observed_at":"2026-08-07T05:01:08.547774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.522607Z","title":"Example Input: A young woman holding a racket hit the ball, and the ball flew outward","venue":null,"work_id":"4a6ea99d-dd82-4aaf-8e84-a25ac26b2a01","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.250450Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:ada5b0612272fa8c45a2c878d76a0feec279d13f01899bfe4474047476fa1426","observation_id":"a125a548-442b-48f1-8e97-5a7935069a43","resolution":{"observed_at":"2026-08-07T05:01:08.528325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.506987Z","title":null,"venue":null,"work_id":"0beb6963-bb20-48bc-a677-b3358c97e0dd","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.255371Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:5feff6d790436437140a29e22bda0e435ea4d5cdb5cc24e2edfb337004703d9e","observation_id":"98563f15-079f-4b01-877a-75ae0aa6db83","resolution":{"observed_at":"2026-08-07T05:01:08.512290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.490750Z","title":"Output (causal):","venue":null,"work_id":"8041a02d-d207-4304-8225-497ef8995e37","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.260715Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:15c0ee0373c3bafd1931936f09e7f983cfc8130bdad8a021fde4287b21991ce4","observation_id":"87f61e64-b74d-41b0-90d6-958147e1b9ef","resolution":{"observed_at":"2026-08-07T05:01:08.495564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.464419Z","title":"dirt” with “paved roads","venue":null,"work_id":"d062cd63-8a23-4bb7-9055-671b12fddd3b","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.265588Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:6a8971089fce3adea7626428c02e9b8ac74da80ce7f1a08faa29fd982abde6cb","observation_id":"b3fa6ee5-d2a5-4657-a4b6-db4745d88fe1","resolution":{"observed_at":"2026-08-07T05:01:08.474047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.439779Z","title":null,"venue":null,"work_id":"e15eba82-8162-4667-882e-cc0fc0130599","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.269999Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:116868fad3422020a5a878d2ec482fd428e58df647d7a54578ef1bbbbabd1c51","observation_id":"37f1a45c-cfb8-476f-877b-b90457564489","resolution":{"observed_at":"2026-08-07T05:01:08.446664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.423114Z","title":null,"venue":null,"work_id":"dd24924b-b022-43f6-a87e-dd3438aef71b","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.273979Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:97464dcfc402dc4e90973dde3da94b832591b00510fe4b5703d223cc8365d99b","observation_id":"b49d51f6-6c25-4ba7-827c-78703bf04ab2","resolution":{"observed_at":"2026-08-07T05:01:08.428518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.405851Z","title":"causal decision points","venue":null,"work_id":"4a7b16fc-2029-468d-a9c1-648b072a4e43","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.277833Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:9698035c3f211c5142301817b8eca83078b3db3e4d6b704e8b58c98e6d34aced","observation_id":"efcd3bf2-24ca-48b3-95c4-1d7b15b217ad","resolution":{"observed_at":"2026-08-07T05:01:08.412119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.387704Z","title":null,"venue":null,"work_id":"74896d65-b427-4ea5-bd43-1dac0c14cacd","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.282997Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:06ac03460e4e76b7fee50f23000fae6e179997e93f85b782f81d65a2810dbad4","observation_id":"1a1cde11-e036-45e2-b861-38daf8f12ede","resolution":{"observed_at":"2026-08-07T05:01:08.393260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.368816Z","title":null,"venue":null,"work_id":"37234ba1-68c5-4838-84dc-793b81d9bbfe","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.287322Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:d99669c415c1cff4f036dffd54422a5c175e00a0ee9ae6c34f22a8b75a71cef1","observation_id":"5504e3cd-2e3b-4cfa-854b-3e4a660c462e","resolution":{"observed_at":"2026-08-07T05:01:08.375706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.351726Z","title":null,"venue":null,"work_id":"f79ebafb-4527-4b3d-bce0-36da8a7b482f","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.292067Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:1e215e3c248efc855a6c207f851204782f9e62a20f7ef1d337c85b9651a40ff5","observation_id":"72662f1d-9f16-4588-bd8f-3ce329cae31a","resolution":{"observed_at":"2026-08-07T05:01:08.357028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.331584Z","title":"Two people on motorcycles riding them","venue":null,"work_id":"4b2d1bb0-e17e-401b-a172-5490e764b6be","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.297273Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:53fa2a224658b0371f34cacae2294e0b8dcc32628fb5ebd9ed9b57f1cd05d25d","observation_id":"b4b55706-9edf-4850-8635-25e55d99d1eb","resolution":{"observed_at":"2026-08-07T05:01:08.338390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.311976Z","title":null,"venue":null,"work_id":"e4c02a2e-3079-4209-a0f8-d2a9ee51fd96","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.302045Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:f7e835e43a320ca59eb06c269fc415d1bf037faa3ffad6671f9ab3fe2e62304f","observation_id":"ef86dff8-a5a1-4677-9571-c66da1bcdad5","resolution":{"observed_at":"2026-08-07T05:01:08.316820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.293620Z","title":null,"venue":null,"work_id":"bdd13430-763a-4ba2-82d6-32fa2a03d4f4","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.306355Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:10838e2dc356fb5127d97e3506deaed434d8221e92c59f7c5fc48b7d1e44da05","observation_id":"c2267686-b567-446f-825c-7242bcfec410","resolution":{"observed_at":"2026-08-07T05:01:08.298808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.275166Z","title":"causality","venue":null,"work_id":"b011d602-8535-4f59-89c7-0437a8e49311","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.310308Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:06394bfc5bb8dcd58456f256e8961c0b82f175ba2371fbeed2dea7d3756a265c","observation_id":"dc45ff25-b0fd-42b3-9c54-1e74ba3d9c7a","resolution":{"observed_at":"2026-08-07T05:01:08.281488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.255010Z","title":"parallel realities","venue":null,"work_id":"628f8d02-2882-4663-836e-380976d43e40","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.314460Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:f67fa5656db5278c298428f810c4c87c754e81d9f6f3f67adb0a58efb3ce19b1","observation_id":"5e3b4834-cbbe-463d-ad1c-215fa2526338","resolution":{"observed_at":"2026-08-07T05:01:08.260724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.239212Z","title":"These are employed in Lcsd to help the model learn semantic scene boundaries","venue":null,"work_id":"db218ba6-de89-47cd-8f28-54d6d3f2f285","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.319372Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:6746f8266c18e9eb90871d122bc18f873476d142aaa09cb6d61b362ef4ac3165","observation_id":"443bbec6-8f01-47e4-a298-1b68d0e77f84","resolution":{"observed_at":"2026-08-07T05:01:08.243881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.220551Z","title":null,"venue":null,"work_id":"bcd8ea4a-0fa3-4732-8123-e07cb2b817e3","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.323874Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:f8406ab141265763a2200179c313bc6547e116579da614f0d83e74b0dc72e736","observation_id":"7aa85fba-ece3-4611-85b4-63191fb81046","resolution":{"observed_at":"2026-08-07T05:01:08.224933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.204436Z","title":null,"venue":null,"work_id":"fc61e9c0-2327-4c5e-bf52-2d87a8f1ee86","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.327832Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:132d004f9781c0de1652e19da77a1df8a09f0f2d550e87692c883897757abedf","observation_id":"527bc56b-0dc5-4d77-bf56-110aaa7a9aa8","resolution":{"observed_at":"2026-08-07T05:01:08.210112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:08.190018Z","title":"kicking a ball","venue":null,"work_id":"273f7899-a33e-42a3-9311-10069081c145","year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.332466Z"},"links":{"citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:d34c9addaa1eb3aad69e2872d954ce839aac146650c6eb72c95a25fa0de9d716","observation_id":"39db48cf-7edf-4131-b359-6611f6b84ee1","resolution":{"observed_at":"2026-08-07T05:01:08.194421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05465","last_updated":"2020-10-12T05:45:44Z","snapshot_observed_at":"2026-08-05T16:52:21.873290Z","submitted_at":"2020-10-12T05:45:44Z","title":"COGS: A Compositional Generalization Challenge Based on Semantic Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05465","snapshot_observed_at":"2026-08-07T05:01:07.080997Z","title":"Available: https://arxiv.org/abs/2010.05465","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.080997Z"},"links":{"cited_paper":"/paper/2010.05465","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:efdbb270d9806548d25afed8f907e660f1ad35ef7b26707c1dc7659e54d207d1","observation_id":"d6f96fae-5544-4683-a0ec-c5087db8e7fc","resolution":{"observed_at":"2026-08-07T05:01:07.080997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-14T05:56:43.101287Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-07T05:01:07.007888Z","title":"Available: https://arxiv.org/abs/2405.02246","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:07.007888Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2506.17267"},"observation_digest":"sha256:544f6c8a786db8c2c5655fbbe77454d440a0aa64341c5781d30dbf9badc0b542","observation_id":"f17ba9ae-74f7-42d7-bef8-edc49c67d258","resolution":{"observed_at":"2026-08-07T05:01:07.007888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17267","last_updated":"2025-06-10T20:20:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T19:59:20.205509Z","submitted_at":"2025-06-10T20:20:05Z","title":"CF-VLM:CounterFactual Vision-Language Fine-tuning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":7,"verified_fuzzy":33},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 4 inbound Pith citation observations for arXiv:2506.17267."}