{"as_of":"2026-08-11T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b11667a6923505a2b61cef2199c24cdc437b2fe9b5b5daa0f6441db3c1a6bf8","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:33:43.018059Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10416/citation-record","integrity":"/paper/2506.10416/integrity","json":"/paper/2506.10416/citation-record.json","paper":"/paper/2506.10416"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-07T04:33:34.550596Z","title":"Deep variational information bottleneck","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:34.550596Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:e05f099bb472417f8e03cc4728d8b2ab2f2da730eb1329e8c1760b78daea26c8","observation_id":"1eeec5c1-e129-4f26-8102-1c04208b468f","resolution":{"observed_at":"2026-08-07T04:33:34.550596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:57.855388Z","title":"Arandjelovic and P","venue":null,"work_id":"4e777fc5-69c9-4331-a8eb-b1a951a502b8","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:34.722897Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:fb8e065073f6a5c4a9189db4bcda95bb1ba183153982bb97d35ed57371eef889","observation_id":"399d9b91-dab0-4331-bc52-2ecd06612ede","resolution":{"observed_at":"2026-08-07T04:33:57.983039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:57.519086Z","title":"Eagle: Egocentric aggregated language-video engine","venue":null,"work_id":"e5f2a0ee-a084-43cd-a937-38f6d33818c3","year":null},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:34.900943Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:fcfcde3e36d1b78ff67b4e09339ddcc74e6b0ea377c66452e8ed52632924d21c","observation_id":"25b4e1c7-bac9-4129-9302-39a680047730","resolution":{"observed_at":"2026-08-07T04:33:57.700719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:57.214624Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"8e7d76be-70da-4e50-a683-2057b7fca777","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.074043Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:77aba540897918a96bce562e262d88136c3e31c645b5e95a1c09daf472c2d0eb","observation_id":"f7582180-498f-4591-a8a5-08b2f53abd49","resolution":{"observed_at":"2026-08-07T04:33:57.349878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:56.903024Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"8a519097-7220-4eb7-be0a-4320c4a1f6e7","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.222849Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:9369a088ca1d88ba3ecf64e1b983044dd43ecec8f4df0001f5996034c0a9da95","observation_id":"1ec82599-025e-4684-806a-cccee916717b","resolution":{"observed_at":"2026-08-07T04:33:57.060553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:56.608957Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"662a040d-f8ba-4085-9fc2-d1a8be4eaff4","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.398977Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:0f0962d06f451d50aa3b004e5645ab0684a121ecde5abc72671704181e75e144","observation_id":"0b3aa060-f582-4a32-afff-b3bce5803e62","resolution":{"observed_at":"2026-08-07T04:33:56.756949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:56.354255Z","title":"Audioset, 2017","venue":null,"work_id":"10a5ee6e-74c6-4b35-9d8e-536d7f0664a9","year":2017},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.537791Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:c55ba797531614095ab90f64bccb24064f0cd60ccf4db68be97ad32d4e5dc806","observation_id":"f8ce3aa5-20d5-45e3-874e-87172bf9c4c6","resolution":{"observed_at":"2026-08-07T04:33:56.482953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:56.070654Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"1f538069-e914-4bce-8246-02f55cdb3bac","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.719073Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:85332c78052a2e3f9015dd2f004df283a18bb7c536051108740ee2267c6bcedd","observation_id":"2fb0fe18-772e-4e59-9f9d-e2cb2b8b7012","resolution":{"observed_at":"2026-08-07T04:33:56.215372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:55.703219Z","title":"Audioclip: Extending clip to image, text and audio","venue":null,"work_id":"7f10c922-e4ad-4752-92d2-03f59f4214a4","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.852888Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:30b55465cf915f2948077e084f2e04dd60fc184fc0e67e180f68a24066b17a25","observation_id":"688d5303-08a6-4b08-8916-95101b4fe48c","resolution":{"observed_at":"2026-08-07T04:33:55.881108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:55.408833Z","title":"chirp\" from the","venue":null,"work_id":"61fc6e44-0b44-41c2-a1e3-9a55a5c6196d","year":2024},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:35.996086Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:cea429d62f28a3a13e3f019a1f87831c3eb86ceba28f5a13abf96e525f089b4e","observation_id":"229b3f0b-af1d-45cc-a8dd-ff58ed09cc74","resolution":{"observed_at":"2026-08-07T04:33:55.559027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T04:33:36.134515Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.134515Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:adcb4821246e33eaf2cdc0b56dd82ee1dc002612158887aff0f601025cbd247b","observation_id":"7bf345b4-1253-4cd4-a972-2834263afd53","resolution":{"observed_at":"2026-08-07T04:33:36.134515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:55.094765Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"30273e74-f4e3-4b87-b962-f8f2fe7a01d3","year":2019},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.315150Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:ba4b74bb067611072fe05fb3b14b5d154e7db47625eedd8f974668e79e98cd0d","observation_id":"33696968-3c3e-4fae-b024-5ba2912e6da6","resolution":{"observed_at":"2026-08-07T04:33:55.221888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:36.437297Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.437297Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:718d6221ae5adf992eb4195fa7021f66f29a07c8e548373231987e192dd05f19","observation_id":"0ece4407-90ed-45c0-bb84-e19ffd824ba0","resolution":{"observed_at":"2026-08-07T04:33:36.437297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:54.776530Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"70ec33da-6282-477b-88f2-21cc567b5672","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.573178Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:fa4134b77fe281150897a0fc5c74377a162d5d84cbaca80d02c9051ab946357d","observation_id":"e7805c19-772b-4ef9-8c6f-e235e47ab875","resolution":{"observed_at":"2026-08-07T04:33:54.948158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:36.731603Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.731603Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:f27714a976dc68ee217f17af71e628e78901ac99ecdd87f9b662e81d9093d27b","observation_id":"61577345-de57-47c0-bd6c-798f9fa993a9","resolution":{"observed_at":"2026-08-07T04:33:36.731603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:54.428870Z","title":"Oscar: Object state captioning and state change representation","venue":null,"work_id":"b5341947-298c-4d26-8652-586f8ca48982","year":2024},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.882611Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:f3180835b3e572fbaa1ffe53ed69577ec6f717f1981bbaf17beb088b95963e23","observation_id":"7faa1bbc-c9d6-4356-8203-b052561945b9","resolution":{"observed_at":"2026-08-07T04:33:54.581357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:54.140554Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a9a16471-ed24-4dd5-8207-06516863126d","year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:36.985961Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:7d9c70a51ed0d8b21e51f44be20bb249513a20fcd90a7c71f565f1e696becaa4","observation_id":"99f20e5a-5bf3-46a7-a8e7-18406e0b812f","resolution":{"observed_at":"2026-08-07T04:33:54.274477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:53.830211Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"f205372b-c716-4a3e-9674-3bea0a7e5ef6","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.111056Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:f66a35ec10e514234aff7ce94619c6bb41d2fd5be65249b0c351fe4fa1d99792","observation_id":"22f4aa2f-dee6-4f6d-8559-e3b3135d532a","resolution":{"observed_at":"2026-08-07T04:33:53.979587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:53.472180Z","title":"Tvsum: Summarizing web videos using titles","venue":null,"work_id":"ff96176b-8fec-49d7-98e3-3e071723ba0c","year":2015},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.269770Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:176ccf3c5091e33b7cb1f8e53ac37d51524a126a5a12a8e4735d3001ff243307","observation_id":"64313291-d0c2-47a0-8951-a8fcf4bf8884","resolution":{"observed_at":"2026-08-07T04:33:53.640365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:53.222007Z","title":"From vision to audio and beyond: A unified model for audio-visual representation and generation","venue":null,"work_id":"f4c08cc2-9bc7-44b9-8213-d5f5e6e61cae","year":2024},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.392366Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:c0034de1e05d0f20161deb35f0e1e9026eefcb6be0aa62b0f7a96f4060d38acc","observation_id":"5714cb3f-b4da-4cda-9efe-709e06c74dfc","resolution":{"observed_at":"2026-08-07T04:33:53.338208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:52.955152Z","title":"Deep learning and the information bottleneck principle","venue":null,"work_id":"21c15698-d537-4560-9d77-4127f824cc30","year":2015},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.518237Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:665a8d34beed843d64cc17c7f7a095f3ddf7ccae7df7b3d1f79071215b614167","observation_id":"f68a795f-4049-49d5-8e57-4c0ac710b825","resolution":{"observed_at":"2026-08-07T04:33:53.083973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:52.689821Z","title":"Learning audio concepts from counterfactual natural language","venue":null,"work_id":"d6c3143c-42da-4f0c-813e-19edd540c47d","year":2024},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.637945Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:407c773675a79f59b86aec6730324f3f80ef554b3ed6a76f8a292bba668a24de","observation_id":"aceba966-5d20-446b-af05-fdfcf9689d2c","resolution":{"observed_at":"2026-08-07T04:33:52.816523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:52.409667Z","title":"Quality over quantity? LLM -based curation for a data-efficient audio-video foundation model","venue":null,"work_id":"4aff535f-ad59-49aa-a28f-bf5e80c0e494","year":2025},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.808323Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:50889e1d56e76e8f9d77e976f78885c9a54476d7f4166ffec49e6d7725814db4","observation_id":"a6d8834f-01e8-4935-9b08-ee2af8f4e48c","resolution":{"observed_at":"2026-08-07T04:33:52.532284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:52.107052Z","title":"Wav2clip: Learning robust audio representations from clip","venue":null,"work_id":"1b63822b-318c-4ce7-8711-d6cd39200bd7","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:37.984137Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:84bcbcb8de47a4453b66e45a13a366424124f66f1e902698cd238edcdb5abc50","observation_id":"17c23739-ba88-4dc4-ad22-fbe49fe4f1c2","resolution":{"observed_at":"2026-08-07T04:33:52.272157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:51.852806Z","title":"Rangevit: Towards vision transformers for 3d semantic segmentation in autonomous driving","venue":null,"work_id":"1eb5b382-2280-43d9-8716-7a52030d3193","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:38.150187Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:687009751e9653ec1bcfe5052c2d7015abb3eb8dfb4b2faddcf14b5ea6ba6267","observation_id":"5faf1619-94bc-447f-a128-e519893e1c40","resolution":{"observed_at":"2026-08-07T04:33:51.978934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:51.586309Z","title":"Square Attack: A Query-efficient Black-box Adversarial Attack via Random Search","venue":null,"work_id":"3923d9b8-bd97-42a4-a94d-0d924ee615cf","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:38.314332Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:36152c2eb066ea91bf6a3131b90d0ea797e6aa43ac1ca9c77c9c12b0b0cad4a5","observation_id":"c19962b8-8fbf-4fb8-8e2a-d447e947a18f","resolution":{"observed_at":"2026-08-07T04:33:51.734693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:51.275434Z","title":"Adversarial example games","venue":null,"work_id":"855ca5a7-8dd4-431a-9faf-b44c159100ff","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:38.456762Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:6b67c70f40439ab0b6fbaa1ec2e2462ccdd5d02c6f1ece9077e4af69997ed4ad","observation_id":"5e2bd0f7-e70c-40f6-8d5c-acb3f304682c","resolution":{"observed_at":"2026-08-07T04:33:51.410476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:50.988878Z","title":"Towards Evaluating the Robustness of Neural Networks","venue":null,"work_id":"f7ac6ca3-9a83-454a-ba60-3de5b8aeae28","year":2017},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:38.600312Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:d21787d7dd560137b9cc448c2377457a56ef44b4414973eb688a7cc0bf87f28a","observation_id":"ffeaad62-4b5e-4f16-bdf0-2a40badd41e2","resolution":{"observed_at":"2026-08-07T04:33:51.165188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:50.730758Z","title":"Boosting Decision-based Black-box Adversarial Attacks with Random Sign Flip","venue":null,"work_id":"2e807a47-e357-4269-8c21-899eaeb9586c","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:38.762489Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:1f6f12987905d63c338ce3c2cea3452195278c9ad0d93ad83a9bd99856ce947d","observation_id":"b163a716-518e-43e0-bf60-941595ba0217","resolution":{"observed_at":"2026-08-07T04:33:50.880922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:50.417251Z","title":"Boosting Adversarial Attacks with Momentum","venue":null,"work_id":"ace9d701-ae62-4c46-84e0-288660a16fbd","year":2018},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:38.896691Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:882252918d9b00ab22b2b01f9afc6bb3a57d6c77cc0fe38d681af45ce21423be","observation_id":"162bc593-88b9-4252-aa74-b9e015fd55f0","resolution":{"observed_at":"2026-08-07T04:33:50.570310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:50.136381Z","title":"Evading Defenses to Transferable Adversarial Examples by Translation-invariant Attacks","venue":null,"work_id":"cc66cbb3-0677-4f37-909a-de8feebfe02c","year":2019},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.042728Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:3dd5289f0b30d9b5fa243dbbf3246203c0ed20ec34cbfe76d41e3076dfdeb45e","observation_id":"5de57de4-7aff-4281-b5d6-04573fea7f09","resolution":{"observed_at":"2026-08-07T04:33:50.247426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:49.803592Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":"a4f9e657-89cf-4f90-802e-5da4f8472574","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.154387Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:dd096960c11cc1804288d949af470f91c155b8c34a621de7f04417df436205df","observation_id":"691a9c33-bac7-42d8-bc04-796ebf1ff2ef","resolution":{"observed_at":"2026-08-07T04:33:49.965747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:49.514537Z","title":"Patch-wise Attack for Fooling Deep Neural Network","venue":null,"work_id":"9922a087-577c-4b9b-ab03-f5f7023759dd","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.269174Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:041567e97cbb3ab360af6dd4835d7ffd5a430a880a321437fcfcad66b5a84e8f","observation_id":"b7a3cfb9-8ae9-4db3-934c-c7f8b83ddd59","resolution":{"observed_at":"2026-08-07T04:33:49.638510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:49.273489Z","title":"Explaining and Harnessing Adversarial Examples","venue":null,"work_id":"08076eca-a90f-4fa9-8d10-729500046382","year":2015},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.420094Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:900f60edfa145137317979e5719083605ce170506f1ca937ed86c93b46b649b2","observation_id":"911f3898-f876-4803-827a-5927ea5e3425","resolution":{"observed_at":"2026-08-07T04:33:49.380073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:49.025911Z","title":"Lgv: Boosting Adversarial Example Transferability from Large Geometric Vicinity","venue":null,"work_id":"d1ff1bbd-8435-45b8-b29b-a1092e50a347","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.571232Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:8b071fcd6ffd1e794a1bb6d22c7438e32f53533fc27a97f586460044d564a6a1","observation_id":"99a82fea-1f55-4916-b397-54a4a5c8839b","resolution":{"observed_at":"2026-08-07T04:33:49.164734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:48.733763Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":"31486b24-0270-4c60-8a39-1d2ce2f7367f","year":2016},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.684366Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:8fec31aa1d3ae5a65542bd26e57f47f9126e2d97d7c7e6a687d8687ca93bff95","observation_id":"7ce17b0a-e15f-420e-8080-63a941d23db1","resolution":{"observed_at":"2026-08-07T04:33:48.894312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:48.451699Z","title":"Rethinking spatial dimensions of vision transformers","venue":null,"work_id":"b9559b7f-cc37-4409-8d9b-e57694b7bd4d","year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.799507Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:27d1d2d2e543d13ffc9d99ec921468038b5680842902518b22135692a254e169","observation_id":"9549b075-33a5-4ad4-a4b7-6f400c0def6b","resolution":{"observed_at":"2026-08-07T04:33:48.571177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:48.217912Z","title":"Densely Connected Convolutional Networks","venue":null,"work_id":"12767495-df1f-479a-9f6b-c1d2a765c2b1","year":2017},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:39.931642Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:aac2b1de97c0339a91737552ba75cbc090b89168250bf074cb0d9f354f7a62a9","observation_id":"2b82a15c-a747-4962-b1dd-e75f0d75fa96","resolution":{"observed_at":"2026-08-07T04:33:48.326317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:47.914070Z","title":"Adversarial Examples in the Physical World","venue":null,"work_id":"c83cfb2b-1949-4bfe-ab30-0626d438be02","year":2018},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.081411Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:9d41c2b7ac936bc8e53dfe5ac132b51f117a852f70a36246e7f241bc14a6c258","observation_id":"0fab9f73-1bad-4f08-93e2-7d8b6fd9dde3","resolution":{"observed_at":"2026-08-07T04:33:48.056715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:47.626279Z","title":"Decision-based Adversarial Attack with Frequency Mixup","venue":null,"work_id":"233a4d35-a16e-4277-9f86-884370d04ca8","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.227759Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:4eb6e3f9543fcb6501a9738b5dc48ba2dc8784761629be322d5b2271ec66f3f2","observation_id":"0c51461e-4abf-46ed-9e5b-a428033f9080","resolution":{"observed_at":"2026-08-07T04:33:47.758584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:47.317179Z","title":"Learning Transferable Adversarial Examples via Ghost Networks","venue":null,"work_id":"59e3750e-dbe1-477b-a1c6-7f9f18bebcda","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.380157Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:9e011a52237ef897a8523a0b19bbb802b146b0366a90846b62af8e5ac99d9b9f","observation_id":"902a1a39-5021-42e5-a129-e76cf6fb6b34","resolution":{"observed_at":"2026-08-07T04:33:47.457825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:47.063814Z","title":"Nesterov Accelerated Gradient and Scale Invariance for Adversarial Attacks","venue":null,"work_id":"08cc3858-91f8-4f03-a985-bf3a347a9638","year":2020},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.507235Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:c89cfec41bef8b38fce9b9a73a623b8eb70fec50bfb07665d4856a02950e769f","observation_id":"1b884826-fdc7-483d-8d24-4e11505f6783","resolution":{"observed_at":"2026-08-07T04:33:47.203450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:46.809211Z","title":"Delving into Transferable Adversarial Examples and Black-box Attacks","venue":null,"work_id":"8e3b48e7-6414-4ccf-a590-60d5f9e97268","year":2017},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.663487Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:1f2d817eecf34c90dcd7b58e05e9a3af2da398009907ebd349ab21143d38200c","observation_id":"10a42f93-030b-4607-8c3f-6f6bfde9b06d","resolution":{"observed_at":"2026-08-07T04:33:46.947867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:46.581819Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","venue":null,"work_id":"e94ceae3-7f95-4105-a7fa-fbbe9f9cb5d9","year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.778669Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:a64f684432f06ba2493b80ce1dc19b8860c84b4f143a8da125a538068fdfbf48","observation_id":"003a6926-40dc-4584-8f12-4310e49c0681","resolution":{"observed_at":"2026-08-07T04:33:46.690725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:46.325866Z","title":"Frequency Domain Model Augmentation for Adversarial Attack","venue":null,"work_id":"5a9e6532-a460-44d9-9993-fe0874fae283","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:40.899836Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:743a214f6464c6860356f5da94619846ee1d4affb70d6699c55a6281dc8dc066","observation_id":"b8f5898f-aae8-47a4-a262-99784bd424ad","resolution":{"observed_at":"2026-08-07T04:33:46.455924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:46.074498Z","title":"Hierarchical vision transformers for disease progression detection in chest x-ray images","venue":null,"work_id":"b828eb08-3ab9-4dab-84e5-30fbb34e6d1e","year":2023},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.060840Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:6e0b3f90c1999d8beb06d0b878ba3832a6d81ed72d73a6970ff6a3f71abae3e7","observation_id":"37486144-b4a5-4d59-a0dd-0606ec1aa59b","resolution":{"observed_at":"2026-08-07T04:33:46.196221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:45.759992Z","title":"Deepfool: A Simple and Accurate Method to Fool Deep Neural Networks","venue":null,"work_id":"2dc9bdc8-7bce-4205-8de8-81e4459547b5","year":2016},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.220911Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:9a88da4a9a5e523b1bbc57436f83e4e2fb62b8e1aedb9a5ad074921f470bc30d","observation_id":"db8fc341-514c-4879-b35a-eb2e998ce721","resolution":{"observed_at":"2026-08-07T04:33:45.905787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-07T04:33:41.406253Z","title":"Intriguing Properties of Neural Networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.406253Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:9fd84a87ee85be3f67d8d5549580b9e5eb3481f5a443c181fb93c466defb344a","observation_id":"8185f638-4e69-49e9-896b-730c5825501f","resolution":{"observed_at":"2026-08-07T04:33:41.406253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11236","last_updated":"2024-07-16T08:28:05Z","snapshot_observed_at":"2026-08-05T23:26:46.455206Z","submitted_at":"2022-11-21T07:59:22Z","title":"Boosting the Transferability of Adversarial Attacks with Global Momentum Initialization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11236","snapshot_observed_at":"2026-08-07T04:33:41.562333Z","title":"Boosting the Transferability of Adversarial Attacks with Global Momentum Initialization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.562333Z"},"links":{"cited_paper":"/paper/2211.11236","citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:4bade788f81fcee19783cd9bdb808bf8243d2bc4fe4ffdc999f0284bb018c62a","observation_id":"f7aeaafc-7e5c-4128-9721-c41694a4a926","resolution":{"observed_at":"2026-08-07T04:33:41.562333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:45.549255Z","title":"Enhancing the Transferability of Adversarial Attacks through Variance Tuning","venue":null,"work_id":"86c5d080-6491-48b3-adef-7846e3500776","year":1924},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.695567Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:564d711a52115d1947207b8f2e503f51f1e9dddffa519d4a7a2b53dbd432f602","observation_id":"c3357ed4-f904-4556-aaab-43385d4c34b4","resolution":{"observed_at":"2026-08-07T04:33:45.653630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:45.286333Z","title":"Admix: Enhancing the Transferability of Adversarial Attacks","venue":null,"work_id":"83249125-f65f-45c9-a1cb-3255b9fdf4d2","year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.865033Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:a91ab039ff13c84436a1bf525dc1f1c2152c6655badf6ddd49364336831ce4b8","observation_id":"906fdac7-92a9-4306-8443-262cdec68fa9","resolution":{"observed_at":"2026-08-07T04:33:45.420097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:44.964031Z","title":"Boosting Adversarial Transferability through Enhanced Momentum","venue":null,"work_id":"958ab022-70cb-4cd1-afc5-8ab0c4328aa3","year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:41.978382Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:c11ce5b35ae876625edc5801a05a3c9ea67e52fbc7518a49bebcead29b9444c2","observation_id":"fea9f415-d335-4f43-b80f-178a3a154bf3","resolution":{"observed_at":"2026-08-07T04:33:45.144411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:44.658950Z","title":"Triangle Attack: A Query-efficient Decision-based Adversarial Attack","venue":null,"work_id":"83a17a4f-2993-437a-a4c0-ade7b70a9989","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:42.096650Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:8c0a146869826bb2c075a7292e9a5a4f583c0ca1d53e2d10f278c0ecfa409d5c","observation_id":"739907ee-f7b9-4e18-9ec6-d6426b2e6076","resolution":{"observed_at":"2026-08-07T04:33:44.796408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:44.413498Z","title":null,"venue":null,"work_id":"392fffed-bcf4-4e02-9e57-7efde7400738","year":2019},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:42.263455Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:38536c82d55508d6d56dbc0235104bfa81f13c0de74c9d49f2700834ad0a3080","observation_id":"b92c5d52-1045-4180-87e1-d56247199dca","resolution":{"observed_at":"2026-08-07T04:33:44.541442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:44.166476Z","title":"Aggregated residual transformations for deep neural networks","venue":null,"work_id":"790f91ad-5a92-450a-91e1-50630a6e071a","year":2017},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:42.432082Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:5aff9d76af64a1218ab0996cddcd46ab8f4e5b3625fccfb3e731860c114e41e6","observation_id":"d11d0327-8d0e-44bb-b31d-15da0ad856ec","resolution":{"observed_at":"2026-08-07T04:33:44.306326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:43.874207Z","title":"Stochastic Variance Reduced Ensemble Adversarial Attack for Boosting the Adversarial Transferability","venue":null,"work_id":"71bf44da-2700-4bf2-91ba-b0b2c90d909b","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:42.562240Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:38647c14ce747b8cfcef952cb92150245ca1dd5ffaa8c8e7a6abc620c140f850","observation_id":"d575648a-a125-4569-a48b-5f88f5be1e5e","resolution":{"observed_at":"2026-08-07T04:33:44.029146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:43.599772Z","title":"Meta-learning the Search Distribution of Black-box Random Search Based Adversarial Attacks","venue":null,"work_id":"70042e29-59d0-4aaf-af36-efaa3dae4b67","year":2021},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:42.713169Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:2f9db74499e32bbe0c756fb9dde8c72bf82383f60f09973f671efa469c35dbb5","observation_id":"97d36d4d-76f2-42ea-8622-fab888ba1ffd","resolution":{"observed_at":"2026-08-07T04:33:43.749934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:43.380240Z","title":"Learning to transform dynamically for better adversarial transferability","venue":null,"work_id":"ab817f7c-5d31-4c90-bfaa-37972ffeaf59","year":2024},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:42.894400Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:014613235d059586a95fd301b3adebd4dc9006c0a468f76f34e1cc0dd19d494c","observation_id":"1351d327-b91a-4381-beff-3dc01ef964ef","resolution":{"observed_at":"2026-08-07T04:33:43.472480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:33:43.165817Z","title":"Uia-vit: Unsupervised inconsistency-aware method based on vision transformer for face forgery detection","venue":null,"work_id":"e0b3a6a3-3751-4025-bb82-63a64957b768","year":2022},"citing_paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T04:33:43.018059Z"},"links":{"citing_paper":"/paper/2506.10416"},"observation_digest":"sha256:437786ee1bb2e79c8c5d322fed53c39de4faec5969853ab6c36cc9ae0adac111","observation_id":"d561b2b5-bade-424b-9c6f-6b6253c02d99","resolution":{"observed_at":"2026-08-07T04:33:43.260754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10416","last_updated":"2025-08-06T02:35:51Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T20:17:11.751407Z","submitted_at":"2025-06-12T07:14:23Z","title":"Can Sound Replace Vision in LLaVA With Token Substitution?"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":52},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.10416."}