{"as_of":"2026-08-10T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48271242f4386693382cf4d741dd9db8de10921ac4c398789e4a19f4e53258a9","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:08:22.631516Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:08:19.928596Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.22013","snapshot_observed_at":"2026-08-01T06:08:19.928596Z","title":"A natural approach is to leverage multimodal large language models (MLLMs) [1, 2] to enable CoT","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:19.928596Z"},"links":{"cited_paper":"/paper/2607.22013","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:7d9d9756cf02571270263b0b39a76e64efa2728fbc5e75bc62f983ef66152470","observation_id":"572dfe5e-3e16-494d-8acc-a9815007995b","resolution":{"observed_at":"2026-08-01T06:08:19.928596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.22013/citation-record","integrity":"/paper/2607.22013/integrity","json":"/paper/2607.22013/citation-record.json","paper":"/paper/2607.22013"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.22013","snapshot_observed_at":"2026-08-01T06:08:19.928596Z","title":"A natural approach is to leverage multimodal large language models (MLLMs) [1, 2] to enable CoT","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:19.928596Z"},"links":{"cited_paper":"/paper/2607.22013","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:7d9d9756cf02571270263b0b39a76e64efa2728fbc5e75bc62f983ef66152470","observation_id":"572dfe5e-3e16-494d-8acc-a9815007995b","resolution":{"observed_at":"2026-08-01T06:08:19.928596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.198809Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.198809Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:b7882f3a80a452afba5b2818933ac4ac5ef927f712cce75a9a05f20fb859571e","observation_id":"bf720631-acfe-444d-87f2-30a7480b2c1b","resolution":{"observed_at":"2026-08-01T06:08:20.198809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.311163Z","title":"Experiments Settings Dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.311163Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:d654b3e6a67a698d8a8d997bc2b780f78a322895f5b374292a1ce27368e37747","observation_id":"af4ddf06-7860-4887-9d81-91297cb5a3a7","resolution":{"observed_at":"2026-08-01T06:08:20.311163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.727904Z","title":"Existing methods often blur tiny cross-modal cues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.727904Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:2db21b742adea52f040a13676b0783d00785813e41f1cccdf705b7c9c8f939d8","observation_id":"a3f7c85f-0fd3-48f5-a645-97c253b8a848","resolution":{"observed_at":"2026-08-01T06:08:20.727904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.487322Z","title":"Hyperparametersαandβwere 0.1 and 0.2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.487322Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:492897c8f962c47900d54953a29091ed42be99cc014cb38d3654f9fdeb177711","observation_id":"7aafa06f-d25c-4d6d-b9ed-4123f11dfd77","resolution":{"observed_at":"2026-08-01T06:08:20.487322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.478404Z","title":"Joint multimodal entity-relation extraction based on edge- enhanced graph alignment network and word-pair rela- tion tagging,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.478404Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:49ef68f593d1749a48e35360233b43d7f5f3d7f1417b518a05e876ea75d5008c","observation_id":"26f5203e-888a-40b7-8469-4ed0cbe47298","resolution":{"observed_at":"2026-08-01T06:08:21.478404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.891583Z","title":"61966038 and 62266051, and the Postgraduate Research and Innovation Foundation of Yunnan University under Grant No.KC-252513133","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.891583Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:ff19904acf57f0a707a827d5b36d2697dd3f102668e12a76c0741332f085e58b","observation_id":"6cec807d-f14e-4ae5-b327-0d8017c0d173","resolution":{"observed_at":"2026-08-01T06:08:20.891583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T06:08:21.020971Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.020971Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:8d5a9ff283440f85409c16ceb81a73655688ffb13eda13a5022dded634a167aa","observation_id":"05c685ae-b72b-4f81-a279-915143eb7f4d","resolution":{"observed_at":"2026-08-01T06:08:21.020971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.179902Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.179902Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:564c1a34df9a425c3a50aad9642ada756ba63f314234d3e48cef813f7a85bac4","observation_id":"4473e0c0-249e-4700-9d3d-2a9c925875b7","resolution":{"observed_at":"2026-08-01T06:08:21.179902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.063892Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.063892Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:146fa7eccd4d619eb6ed4b8f03c506ba7213f73ffa88683895ec64dbb86bf8f9","observation_id":"ce604d35-73c2-4938-8a38-085c05f2c630","resolution":{"observed_at":"2026-08-01T06:08:20.063892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-01T06:08:21.271702Z","title":"Multimodal chain- of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.271702Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:a12cb267a61917bc65643c0ea866518b28504f231437c712fc8375a5197ef050","observation_id":"5780e02f-3a99-4197-8e69-19c607a59e3c","resolution":{"observed_at":"2026-08-01T06:08:21.271702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.355410Z","title":"Boosting the power of small multimodal reason- ing models to match larger models with self-consistency training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.355410Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:b7abd324a7585e7eab761a4bb5fc7963f66a125b82d97f0661d15dc98fc57e8f","observation_id":"2a635ebe-4c11-456f-8467-c5d86fc0f527","resolution":{"observed_at":"2026-08-01T06:08:21.355410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.408899Z","title":"Vision-aware Multimodal Prompt Tuning for Uploadable Multi-source Few-shot Domain Adaptation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.408899Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:30039ed6a4613637ad118530c0b4ac260a014159011468412a0aef2b1e9e9f93","observation_id":"e07f9f1d-e045-476a-bfe1-e1187881bd0c","resolution":{"observed_at":"2026-08-01T06:08:21.408899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.567687Z","title":"Enhancing semantics in multimodal chain of thought via soft negative sampling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.567687Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:e0d6488259c05cad6832bfe9fa6930a6c4a04316397eb18adb4f13aec5985fa3","observation_id":"80c5a806-f999-40e2-880f-2d9a7e8617d5","resolution":{"observed_at":"2026-08-01T06:08:21.567687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.638785Z","title":"Enhancing human-like multimodal reasoning: a new challenging dataset and comprehensive frame- work,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.638785Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:9b0b1b667faf0ffd70691dd93070be2ec2a5c2c026ac1e84e2a3c412e13e791b","observation_id":"9604640a-1b92-4aad-8055-c052569babd8","resolution":{"observed_at":"2026-08-01T06:08:21.638785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.733047Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answer- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.733047Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:1ab0e1aa7cd771608149db8af050370910e472cb48bd6936091831bae75ec435","observation_id":"2243f7c4-c996-46b4-9ddc-09930bbadad1","resolution":{"observed_at":"2026-08-01T06:08:21.733047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.795830Z","title":"M 3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of- thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.795830Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:ad27ea82498e5fcaccea741baade44c831fa30b0fcf2eea2291caebe139894f1","observation_id":"ea741cca-4a97-44d7-9790-beda0cfcf815","resolution":{"observed_at":"2026-08-01T06:08:21.795830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00700","last_updated":"2020-10-07T03:12:45Z","snapshot_observed_at":"2026-08-04T00:04:27.463644Z","submitted_at":"2020-05-02T04:42:14Z","title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00700","snapshot_observed_at":"2026-08-01T06:08:21.860620Z","title":"Unifiedqa: Crossing format boundaries with a single qa system,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.860620Z"},"links":{"cited_paper":"/paper/2005.00700","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:7c751199e0923ead7838745611f6c4f99a9793529b70931127d17558efcda4d2","observation_id":"244eeeca-a03c-4d74-9700-f779a3922c41","resolution":{"observed_at":"2026-08-01T06:08:21.860620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.993735Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.993735Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:6f4862b8ebebc3dd0919a6db3e3e32e8e3fee19cb2338d677df56b3f2d45f0a6","observation_id":"c45c1e88-c51d-40a4-a3ee-fc9f0ac27808","resolution":{"observed_at":"2026-08-01T06:08:21.993735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-01T06:08:22.141248Z","title":"Visual chat- gpt: Talking, drawing and editing with visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.141248Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:0a58cb571e68bb8be1942bc315110126a47e0a7fd0e92340cabb189dcb6b01c1","observation_id":"bd4a26c1-2b41-499d-88cb-640293d72da2","resolution":{"observed_at":"2026-08-01T06:08:22.141248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14985","last_updated":"2026-06-18T04:46:43Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:19:57Z","title":"IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14985","snapshot_observed_at":"2026-08-01T06:08:22.246100Z","title":"Idealgpt: Iteratively decomposing vision and language reasoning via large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.246100Z"},"links":{"cited_paper":"/paper/2305.14985","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:295d0684bbe55979b4a20431cc81eebe427276a62b0487426d48be8536b604bc","observation_id":"3a77c7c5-ada7-437b-91a1-9d8aa1a48739","resolution":{"observed_at":"2026-08-01T06:08:22.246100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-01T06:08:22.347900Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.347900Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:f80e1a5b308e458594e814b52d122e3f52589e43a120af38a6ed3ec6a396da0e","observation_id":"959dd084-546c-4c63-8354-82e9659ea67d","resolution":{"observed_at":"2026-08-01T06:08:22.347900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:22.497615Z","title":"Cheap and quick: Ef- ficient vision-language instruction tuning for large lan- guage models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.497615Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:d25e0f7117a391b5d2dd737995d6c4d2e8be7f000cffca4ed91b49ecc9d88ef5","observation_id":"d06f4b06-904b-40ba-835e-e0e2ea92bff7","resolution":{"observed_at":"2026-08-01T06:08:22.497615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:22.631516Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.631516Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:22c4eb011f2931f5a9ec5c9ad10ac70abf056ed4dca4974bda1e496766039bd1","observation_id":"23698837-a64a-4597-b497-e49a11a5adb9","resolution":{"observed_at":"2026-08-01T06:08:22.631516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:15:26.226893Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2607.22013."}