{"as_of":"2026-08-07T06:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d885fbacd4b513fa0fb1fe7770947f5acac80c830ad6592aff8ec201382b5e08","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:33:07.477217Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09906/citation-record","integrity":"/paper/2605.09906/integrity","json":"/paper/2605.09906/citation-record.json","paper":"/paper/2605.09906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.tics.2004.02.002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2004 , issn =","venue":"Trends in Cognitive Sciences","work_id":"4893ddde-cf11-4aa8-a037-aac180a9510e","year":2004},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:bfbd56c82b5938d5588ce823f32ffd3b78a613233fb01ee5232e00a8d1719857","observation_id":"45764ddc-6dea-4eee-bb4c-79fe2afd35b9","resolution":{"observed_at":"2026-05-12T04:36:21.179467Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature Reviews Neuroscience , volume =","venue":null,"work_id":"151f2a2e-6442-4839-95b9-211656e9a44b","year":2008},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:803a63e14c8f5a48a523e492d545848a862117f681a7bd59cd775fbd349732f0","observation_id":"0ba1a00a-68cd-40f9-82c2-15c8d53a8c9e","resolution":{"observed_at":"2026-05-12T14:31:39.478724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint=","venue":null,"work_id":"5dde1e7a-cab1-4d26-9463-7f388ef46dcc","year":2018},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:97f9bf43db3adefd2058bcaf6a593bb31e9cbf1009beb0d739f9bb8f6361f6f5","observation_id":"c1473872-cc1d-4610-97d8-4d9d3ca42ba5","resolution":{"observed_at":"2026-05-12T14:31:39.481954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.283","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying uncertainty in answers from any language model and enhancing their trustworthiness","venue":null,"work_id":"c2e415b8-a214-4da8-80c3-8f75c8d52736","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:7b3943311dd908a6b79546443b9529c76c398194224e3e144bf767b91b285cf3","observation_id":"637d90e4-6cb4-4887-9601-278f979901ed","resolution":{"observed_at":"2026-05-12T04:36:21.184027Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 30th ACM International Conference on Multimedia , pages=","venue":null,"work_id":"5c295a37-e89d-4275-ad5c-d4c11bae3521","year":null},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d1c72e5f48e75aa68eec7f8768f7f00df9177ad20a90a4824fcbf20796299605","observation_id":"81efc321-d08d-431f-bc5d-80f6592c24ba","resolution":{"observed_at":"2026-05-12T14:31:39.485288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"5b8b56e6-e0ed-4ba6-8099-c66e7cbae603","year":2022},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2e76638ef3ec0acbf8ba5dc6658f25e3b1a3416a7851753b0c2feaac174fccd1","observation_id":"6fce5ff5-d4c7-4443-84e5-2b4bc0565708","resolution":{"observed_at":"2026-05-12T14:31:39.488860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.375826","doi":"10.1145/3746027.3758261","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , isbn =","venue":null,"work_id":"7f6a4da1-78e0-4558-b87e-738865460f85","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:543cf897c54bbeed050afa5d52a13b96efb5ad1249bdc25dea284328072672b8","observation_id":"784d1f96-9c53-4826-8948-8ec487851706","resolution":{"observed_at":"2026-05-12T04:36:21.168220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i10.33138","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , isbn =","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"38f5bb13-272c-4085-af6c-f6320dcc7bf0","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:c1058f4cc062784c092861b36cfeac61c251e1b8c3b6caee24a498311ebdd0f2","observation_id":"9b5472ae-fd87-4225-b4c7-ee9bc99016c5","resolution":{"observed_at":"2026-05-12T04:36:21.172871Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"eff88690-88bd-44b6-b778-2fffbf612ca7","year":2023},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:acbb4212958d64ad536cbf0539a89601ab7b0bd93907a399c77e01d813dce496","observation_id":"2f40871c-00e0-4560-9acf-372e1e7a5bbc","resolution":{"observed_at":"2026-05-12T14:31:39.562941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"9f2a618d-474c-46ad-b93b-6bf0c88c5f66","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:a0beb23a861d7623de37893ce2664378db1b5f2e479ba85bab291efb0f8fafaf","observation_id":"cce4da37-e48a-4fd7-971b-bf9192d7c46e","resolution":{"observed_at":"2026-05-12T14:31:39.548734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"24e53e9b-f784-4300-9204-fec4653cb8f6","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:fed0d72dadf33747231d91667b853fe54b772fd99647e8b7990a386dfaa5fbec","observation_id":"563e8657-1180-4c9a-9143-e68c76b584cf","resolution":{"observed_at":"2026-05-12T14:31:39.559356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"c9bfbfc2-096b-46b7-aba9-a8d7d1d83ae8","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:50a495ca13c34206d999e9f163964134c3226b1bd2a50646512ea75ffbcaa58e","observation_id":"9b2fcdb5-0b37-44a8-b3cc-e25c59b5eb92","resolution":{"observed_at":"2026-05-12T14:31:39.508380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b6a2e6c2-ae9f-43f9-9cf6-24091dbf9537","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:6f4811b12b5e36ea1a600aa2d7895170dd1a455026feccf964f457875e7fb07f","observation_id":"8e286190-b0a1-4057-95f3-42b9b130d89c","resolution":{"observed_at":"2026-05-12T14:31:39.538141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":"bd0efba8-d837-4b1e-9f84-92496135241b","year":null},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d85c47d25c3aefc86cda3663640a9a17d555c5e2753675e03f466e1c832550cb","observation_id":"4833746b-58bc-40ae-947a-29e90032d0d3","resolution":{"observed_at":"2026-05-12T14:31:39.523968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"cdff9525-3339-4a56-8ac3-d565d30361f1","year":2020},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:3469840ede3fe4c65cddc49bedc4d44098df3f6168ac966cec9424698046d8d8","observation_id":"ffbb2a56-69b6-4fc7-a84e-6d0f7294b082","resolution":{"observed_at":"2026-05-12T14:31:39.545425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"fdc83ac7-c4b3-495e-b778-7841fb83d9dd","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:6653a68ec5c224a15f26f5a2ec676ba2ec544227925438b9c6dcc9d7fe72a4b1","observation_id":"10a27652-d95f-4a40-a902-fd5b91862d7e","resolution":{"observed_at":"2026-05-12T14:31:39.495443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d3b8d94e-65f4-4398-aa71-f553350bb4da","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e1b412756f819103142f1c30edcb47e687bf6eccfb5f8f4cd65f321f2f8db2b1","observation_id":"c941e73d-9f9d-4f02-90f1-435e5887170e","resolution":{"observed_at":"2026-05-12T14:31:39.492273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/nsr/nwae403","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T10:14:35.157974Z","title":"National Science Review11(12) (2024).https://doi.org/ 10.1093/nsr/nwae403,http://dx.doi.org/10.1093/nsr/nwae403","venue":"National Science Review","work_id":"c6ccaa7d-dc85-41a1-bdd8-10c1945d52cb","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e53b154467a5b6de18e15b6e9950197841c80d0e1b0bed543442368ee2cf92e5","observation_id":"04336c9f-6a13-483b-8152-3d6dd7ef0cfc","resolution":{"observed_at":"2026-05-12T04:36:21.141803Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:53.063431+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:53.063431+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"209f15e0-a8b7-4060-8a92-32074f0abda4","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:2f0ae84d756d5af89ab30cc2e21f5297c11280847ead90e199ce50b21169b1d6","observation_id":"95ce46cd-8598-4e98-84d9-3c8fe0b0e033","resolution":{"observed_at":"2026-05-12T14:31:39.501728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"932c693e-9399-45a9-99a3-a753dc4e97b1","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:efcdb7df7b8be28278fd3ade7550d82adf47b4ae49cb76fde16c454d6bdee43a","observation_id":"7c1f4987-f77a-4b08-874c-2c967ab347c8","resolution":{"observed_at":"2026-05-12T14:31:39.527304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"2a21c15d-dd8d-4c8e-92ec-7822a4e75bf5","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:338834f6cd6ea979979dcadfc1ea3f7cc56153907091bd949a3a448a2db69af7","observation_id":"535c203b-40b6-4b16-88fe-2caaafcebe06","resolution":{"observed_at":"2026-05-12T14:31:39.530578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"2b95bc96-e1a9-4491-8d94-72a6e232464e","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:85aa7041505b514aacc9c503e90da794645830940eedeeda2aae8071fa277338","observation_id":"89c4f683-7652-4e9a-8d86-6fa52c307737","resolution":{"observed_at":"2026-05-12T14:31:39.552259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:3ad91dbc61d1f8a6573ac4607d56b20a46e28804074685159ad44152556fcf80","observation_id":"05b6f224-a575-464e-86de-ac1697d48362","resolution":{"observed_at":"2026-05-12T04:36:21.137050Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"fb7a0ec9-252d-463f-a503-417a63f226fe","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:9d8809e1929e8930f74672253bb1095772819badc0734072451047dd90987aca","observation_id":"6f68a65a-daa6-4338-bfa5-7e2272e4520b","resolution":{"observed_at":"2026-05-12T14:31:39.505077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"a3d815bc-fe10-4af7-9f8d-54f1a080f667","year":2023},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:64a313403a38cc5529e2190ed31d4ecf839ab4d18f8f533e390c8712fc47f82c","observation_id":"942b2bbd-fe5f-487a-9dfb-7bd0c487b2ae","resolution":{"observed_at":"2026-05-12T14:31:39.514731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"d2e3d037-719d-4e6a-b462-5cce4550357e","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e023ac43aa6568419baa9fa608485f3363b15a2ec7cf9482c8fbe13f9c8e5c41","observation_id":"cb1cce58-5526-40ba-8235-24234745a489","resolution":{"observed_at":"2026-05-12T14:31:39.511484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"74e3e071-6876-4d5a-a8fd-93bcf0d24923","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:ad40184f9f262e0030763b1ddc572f04a5d12ae0aa361b2f6fe260438ea0107a","observation_id":"e0687a99-8e46-4064-b446-db7046b61490","resolution":{"observed_at":"2026-05-12T14:31:39.567392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"e526fda0-3695-426b-8ecb-b916a4c029af","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d210a76176bc61e11c21232fb85d217d63e75342953b0f887c9cdefe55963be6","observation_id":"a3036e61-6463-461f-8834-8d9e36ea5f3e","resolution":{"observed_at":"2026-05-12T14:31:39.498839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"0210a214-b6e7-4f3e-a74d-b28e467e8feb","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:e99c27ca3c0b225600de36f1b67b33785065c64c6a24601e1c613494261be2f2","observation_id":"e7cd9466-f6f1-416d-8bff-e7b30c04b9ea","resolution":{"observed_at":"2026-05-12T14:31:39.555757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"78f40846-9095-4211-af17-7e29ea52052f","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d3c3957dbc924635069ec04b8ae8998acb73025cd229e2984b93bc92aa2442c8","observation_id":"50742264-1049-4bee-baf7-72571cc144ff","resolution":{"observed_at":"2026-05-12T14:31:39.518160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:46:35.433494Z","title":"2025 , eprint=","venue":null,"work_id":"e6435118-6ff0-4575-93e2-7748e205a26c","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:38742f2f74ba6093cdab742c1efba7cf56d2711aef6c37acabf3f6315a9bac35","observation_id":"0b1dccc7-0075-4aab-a7f6-69cfd88af1b1","resolution":{"observed_at":"2026-05-12T14:31:39.521061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"aedfde7f-c30d-455c-969e-e222d1498bc5","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:a33c1957926383802280a7b8379ec0972a3cead4261eb18024e41209b605f469","observation_id":"b4bcb8fd-eb69-4731-892d-9a706369e735","resolution":{"observed_at":"2026-05-12T14:36:37.890631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-short.86","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Correlations and Beyond: Understanding and Mitigating Shortcut Learning in SDOH Extraction with Large Language Models","venue":null,"work_id":"7a9046fa-a0bd-48c1-ba8b-4b8e9f09a4af","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:4a7a6dd582b7af5d35a81b0fc746a0593de4eb406d661445bff0485d53be62bb","observation_id":"1d3b8829-05dd-4bc3-9a3b-51e3be4003e6","resolution":{"observed_at":"2026-05-12T04:36:21.145754Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f54e5205-0c6c-41cf-812d-6f3557a227b6","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:8e1d35771d2b2fc5bff1f1595d9495302913c3e250b94987d5941584707b8d4f","observation_id":"a47b40e1-4c02-49a6-9872-ba4c2399f30e","resolution":{"observed_at":"2026-05-12T14:31:39.593131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"68de1e82-a68f-476d-b36c-e6250559a2c6","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:232ed261e908dba6b73642a1bce7f81d019b5637af0713bdd24447e7ac3053c4","observation_id":"804fab10-fdfc-4cc8-8b9c-22dff6067d60","resolution":{"observed_at":"2026-05-12T14:31:39.588621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:13:13.427644Z","title":"2025 , eprint=","venue":null,"work_id":"d195075f-38e9-459c-a5c7-eb63d0057209","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:bc2e1e4299ce00d786d0c225818f535ff5b3f05b1a9285463845b1257bb463d9","observation_id":"f0b1ea68-cb16-4503-bd36-01a2903d33b0","resolution":{"observed_at":"2026-05-12T14:31:39.534652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"af0815fa-5125-4553-8dcf-8721789c8ecf","year":2023},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:38f2f2fb860b7607800ce2d14ab16d22830dae055122cf4695d219614d65e669","observation_id":"2f420385-78fd-4acb-88dc-93418a9f5cd8","resolution":{"observed_at":"2026-05-12T14:31:39.542067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:57db8b22c6c9c79339f84464252c8914c0b1dd45dcdfaebcb702e03b46b2e770","observation_id":"9177615a-d806-4d8e-a6ac-fbe1f4500c81","resolution":{"observed_at":"2026-05-12T06:11:22.896828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"4d2211b3-2a17-460f-b94f-875b83bb972b","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d0169519b00bd862781300cd004be4bf97da6023cfa39e3a0c836f04ecd561f6","observation_id":"e7e3579f-1e70-407b-be99-2ea12c9a229a","resolution":{"observed_at":"2026-05-12T14:31:39.584931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"afc3e4b6-c706-402a-809c-609194cd759d","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d87406fccd51d4c9dffdb0cc98a76e09660b0996979bb054a498ab844dc36e67","observation_id":"2822b90d-8486-4abf-8833-edf950f8e5ba","resolution":{"observed_at":"2026-05-12T14:31:39.581582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:07:07.043919Z","title":"2024 , eprint=","venue":null,"work_id":"6ab6df8a-78af-4544-b925-880827175ee6","year":2024},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:0be0544092f81d651abc6ebe14c54d0dc2b415b9161acf9b1ae0364745da3301","observation_id":"c9cd4231-90d9-4315-a4b3-142477646a18","resolution":{"observed_at":"2026-05-12T14:36:37.898575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.488352Z","title":"2025 , eprint=","venue":null,"work_id":"8fb5d482-cf5e-4141-b15a-3f607aa09f83","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:bec0a3a73925b955ae3114f89bf2c59d719d0f0f6f74bc97130870e386bcded1","observation_id":"11e68aba-61ac-4cfd-a653-fa6ba4269b21","resolution":{"observed_at":"2026-05-12T14:31:39.574484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:41:47.882398Z","title":"2025 , eprint=","venue":null,"work_id":"d6e38a0f-1e6e-46d7-8904-c1f5cc263195","year":2025},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:d4da67cbffc19f43f25fbdbf52a8e0e9657293fab37a38d3b9de9233e321ccbf","observation_id":"edae379c-0136-4572-9937-f373bbe0f882","resolution":{"observed_at":"2026-05-12T14:31:39.578188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint=","venue":null,"work_id":"7af800e7-cc8c-4611-b3b3-237f9d7a689a","year":2017},"citing_paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:07.477217Z"},"links":{"citing_paper":"/paper/2605.09906"},"observation_digest":"sha256:afc9d28a4daf0df01bf85ae39cb2c8c19cd0e4bfa79cb2db5c84e7b6745f36f6","observation_id":"c24e24b2-531e-498f-b247-6691d5386904","resolution":{"observed_at":"2026-05-12T14:31:39.571006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09906","last_updated":"2026-05-11T02:50:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:50:27Z","title":"Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":5,"verified_fuzzy":35},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.09906."}