{"as_of":"2026-08-17T01:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c67ca2b295125e24ff59700f168ea242eeb4369976bc3e3168683ec1e28f4e3b","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:27:08.640131Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:58:24.192980Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:19:00.613121Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsemm: Head sparsity emerges from visual concept re- sponses in mllms","venue":null,"work_id":"caeb691f-c1fc-412a-b749-054d5e417ac9","year":2025},"citing_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-08-12T13:36:20.792686Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T04:17:07.534291Z"},"links":{"cited_paper":"/paper/2506.05344","citing_paper":"/paper/2511.22663"},"observation_digest":"sha256:510afb38a6d62f7a62c09a99c693acd48b7c7b6f63c8ef7f9d37cccf0743d297","observation_id":"0b1cdba5-adfa-49f9-afcc-4a467b4f0d1d","resolution":{"observed_at":"2026-05-17T04:19:00.615863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsemm: Head sparsity emerges from visual concept re- sponses in mllms","venue":null,"work_id":"caeb691f-c1fc-412a-b749-054d5e417ac9","year":2025},"citing_paper":{"arxiv_id":"2604.05887","last_updated":"2026-04-07T13:51:07Z","snapshot_observed_at":"2026-08-13T04:27:12.473145Z","submitted_at":"2026-04-07T13:51:07Z","title":"HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:58:45.374139Z"},"links":{"cited_paper":"/paper/2506.05344","citing_paper":"/paper/2604.05887"},"observation_digest":"sha256:d293aa8af05802fd9baa44beb4b746fcc3473400fec508cd3f3fa75d809e4069","observation_id":"a261b1fc-71ba-4d0d-a62a-b64b28187b29","resolution":{"observed_at":"2026-05-10T22:20:48.359879Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05344","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsemm: Head sparsity emerges from visual concept re- sponses in mllms","venue":null,"work_id":"caeb691f-c1fc-412a-b749-054d5e417ac9","year":2025},"citing_paper":{"arxiv_id":"2605.14710","last_updated":"2026-05-14T11:28:57Z","snapshot_observed_at":"2026-08-13T01:53:35.280169Z","submitted_at":"2026-05-14T11:28:57Z","title":"Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T04:46:46.504349Z"},"links":{"cited_paper":"/paper/2506.05344","citing_paper":"/paper/2605.14710"},"observation_digest":"sha256:2e7ea6aa955732d8988e169719e7d6a2d7524b27153fa29014858121e482fc48","observation_id":"212ef584-9dba-4f4d-b6bc-97a47fb067a8","resolution":{"observed_at":"2026-05-15T04:49:44.490639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05344","snapshot_observed_at":"2026-08-02T11:58:24.192980Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22586","last_updated":"2026-06-09T04:56:59Z","snapshot_observed_at":"2026-08-14T07:43:49.522213Z","submitted_at":"2026-06-09T04:56:59Z","title":"MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T11:58:24.192980Z"},"links":{"cited_paper":"/paper/2506.05344","citing_paper":"/paper/2607.22586"},"observation_digest":"sha256:611b7866a318710645c6b5bc9cd5b7eec80583156f85b10e6da3514fb7eba8d7","observation_id":"20c69d2f-748e-4b1f-8a59-577e5f5e0335","resolution":{"observed_at":"2026-08-02T11:58:24.192980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05344/citation-record","integrity":"/paper/2506.05344/integrity","json":"/paper/2506.05344/citation-record.json","paper":"/paper/2506.05344"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T10:27:08.449132Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.449132Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:3ba3d3f18dd97cacdfab8024f6d82c8a9968519b2f04e9986354cc7f52b79b9b","observation_id":"f1a487d4-c014-41c4-b463-c685878d72ae","resolution":{"observed_at":"2026-08-07T10:27:08.449132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T10:27:08.454196Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.454196Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:1e9bcd526f60228d1f4d2e2052e1dcf962d0cd025b312df64709af0c3b1e17f3","observation_id":"30b24c70-51c7-4512-96b9-8039577fb7a0","resolution":{"observed_at":"2026-08-07T10:27:08.454196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.452583Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"a882e7d9-10ed-4677-83ad-485225c0c135","year":2022},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.458359Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:974d7eb7d8495044bd17fe6624301128897b4d5869cad5d25ffc9765a1312611","observation_id":"00d6d9a0-2177-4bb9-8c8c-639e6a5d81af","resolution":{"observed_at":"2026-08-07T10:27:09.455862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-07T10:27:08.462063Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.462063Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:b03123844ab378a7b10999b4cb093ac83c7903132f88915cd8d57bd7f5647f73","observation_id":"d713e9f5-3123-4627-b5f8-88b5dfccacdf","resolution":{"observed_at":"2026-08-07T10:27:08.462063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.441947Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"cc0fced2-6e41-4574-9c15-420a5b63f265","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.465830Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:d1f046773468c81f01320ab491d5488734af1fca4e7bccda1d2e3d61e52b91f2","observation_id":"09c4e02b-ce26-43cd-960b-ae0e4de99916","resolution":{"observed_at":"2026-08-07T10:27:09.445708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T10:27:08.469397Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.469397Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:3cc98c449e896e31485602ed4cdac3cd9b3a297c72484fd0bafc69eb92c7ed30","observation_id":"41b0d03f-1c55-4e2e-9529-cea3d74a40f8","resolution":{"observed_at":"2026-08-07T10:27:08.469397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.432384Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"b598f835-35bc-4ba1-83f7-ad57b3157ebe","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.472691Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:35a44b6a0880ad5a52b59404b726240d7826e0fc28035e91386176feadedbcdb","observation_id":"121a992f-c3df-4580-a1ec-5b88c8971bfa","resolution":{"observed_at":"2026-08-07T10:27:09.435577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:08.476233Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.476233Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:5e4e5a7b55ce91e372277fb22eaa476f32a7e656a1e89f25c2dbf3a4165ce1a1","observation_id":"8d896789-5e63-4b86-bccd-3b1e19ff9551","resolution":{"observed_at":"2026-08-07T10:27:08.476233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.415006Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"ba1e4a88-1aff-4938-9a94-f4344905c262","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.480207Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:82a3b2c53bcf4b77b437ff3ce970d8a309283d18396b4944ee4906f303d452ae","observation_id":"7d288c32-e4eb-41c6-8ebd-666ffc17a68e","resolution":{"observed_at":"2026-08-07T10:27:09.418655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-14T01:28:00.438542Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T10:27:08.484085Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.484085Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:0b4b6daea12d35141482b42f3f1001617e2a7f6ba5b8082712a290cc83ec1bfb","observation_id":"67242505-2a02-4a27-9a10-cf79db3fc8f0","resolution":{"observed_at":"2026-08-07T10:27:08.484085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:27:08.488311Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.488311Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:f9d09162ddfdaa9436edffef9f05176ee4a59c56fe472750f20443a1da12b59e","observation_id":"e5496a26-e016-4da9-a8fc-e4dda3744dea","resolution":{"observed_at":"2026-08-07T10:27:08.488311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-16T13:23:55.587572Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-07T10:27:08.491781Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.491781Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:a13890223716589581127f688b0500b0fef8c67507c4c8cd00d95eae48e873be","observation_id":"7952014f-ff33-40b3-bd24-7d4a7bfe2962","resolution":{"observed_at":"2026-08-07T10:27:08.491781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-07T10:27:08.495177Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.495177Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:496ef57b89f2a9c7a55634d92f1a03c06be4dc895d961d2b8b2f27237a1cc386","observation_id":"ac0ab6c1-82d3-4b2d-aca3-764827709fda","resolution":{"observed_at":"2026-08-07T10:27:08.495177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:27:08.498592Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.498592Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:02549e13b6f1694d982db5e43dbd5df304a8e3799661a784e3394783ae7d0440","observation_id":"6c2de33d-1360-49a5-acef-c9dfee767dcd","resolution":{"observed_at":"2026-08-07T10:27:08.498592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.404919Z","title":"Making the v in vqa matter: Elevating 10 Table 5","venue":null,"work_id":"d795cbab-c17c-49ed-b3ac-b82a48227baf","year":2017},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.502558Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:97bd6ffb23080178d1c8f6a5e03783dbd28612b47b9d7ef65daa1e13584a919d","observation_id":"63365273-1d7b-4e50-ba2d-491ff0d3623c","resolution":{"observed_at":"2026-08-07T10:27:09.408293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.393208Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"0879ae39-53f4-4081-afe8-20cba2e07317","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.506621Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:a80141ee5cc2f0169d0efe0dd5eb109cd33f94a8a96a482e4cb3aed17012e9cf","observation_id":"c0c7cb53-1ab4-4faa-885a-f2ed5bf3b6e3","resolution":{"observed_at":"2026-08-07T10:27:09.398366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T10:27:08.510563Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.510563Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:bd75a8e63d7ffeebf3cb6daa620e72562cef7a52dce46f6f2a75ec9b77a93b8a","observation_id":"09be408f-3fbb-42dc-8bc7-ec2a5a59dbff","resolution":{"observed_at":"2026-08-07T10:27:08.510563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-16T17:38:06.620846Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-07T10:27:08.514999Z","title":"Donut: Document understanding transformer without ocr","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.514999Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:6a98b3f1c24f521a5924c0d904b974cb28293d4f80b94e7884c11c0c85804df2","observation_id":"f7abf4ff-69a0-4b69-bd96-f571d0398808","resolution":{"observed_at":"2026-08-07T10:27:08.514999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:27:08.518799Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.518799Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:a4949e6b3a2c00ec23373164faf4b9952367c67653ac82141a1999e6d4f461e9","observation_id":"640f0432-a767-47d9-a292-4374171e99cf","resolution":{"observed_at":"2026-08-07T10:27:08.518799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T10:27:08.522356Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.522356Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:26528fc42a95fa5a115ba2190e4e617cddcbe0b8a3030c7d3cf128c9adb99322","observation_id":"396755af-003a-4a95-979d-1e876c601d0a","resolution":{"observed_at":"2026-08-07T10:27:08.522356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.381744Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"b55b92a7-b9c6-4172-8433-1d84603c77c9","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.526082Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:db413b84766ffe91ec081eba2f354c0b1774812412c1fda93b5e7fc6dba99f71","observation_id":"566c391c-e7fb-4133-96e9-fc9bb910babf","resolution":{"observed_at":"2026-08-07T10:27:09.385069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.370504Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":"7608625e-f484-46d3-b082-41c76c42a30f","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.529743Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:d805e4c6818f4bd1efeb5786a8f49dd45a06c7070b5139358077d7795dc42d22","observation_id":"0d849c97-1c3e-48d8-8227-a99196537bef","resolution":{"observed_at":"2026-08-07T10:27:09.374282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:27:08.533143Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.533143Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:7caf0a5e32c1388c3a245c6774f3a7ef781ffc93aab0f530aa13c6b81b3312b7","observation_id":"dfdf24db-2228-4f65-a7fc-ac019be7592f","resolution":{"observed_at":"2026-08-07T10:27:08.533143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.359316Z","title":"Vila: On pre-training for visual language models, 2023","venue":null,"work_id":"8c81a15d-29ea-41de-9806-1d9ec672c3ba","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.536916Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:d6a581cd56eca814d51c047d3a4f42be915b27300418c705ef9d45dbc422734d","observation_id":"7567f1c9-e52e-4032-85df-1142b59b0f03","resolution":{"observed_at":"2026-08-07T10:27:09.362742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.348078Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"b59c22a1-60b3-443b-bf6c-db5fc2c1b6d7","year":2014},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.540172Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:9de7a28521ca97c55db9053956c222c131cb3280e8720bdb85b91652aabdfa12","observation_id":"3d4782ca-92f8-4721-be6a-e396167148e9","resolution":{"observed_at":"2026-08-07T10:27:09.351838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.337585Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"47e08633-69b3-4b05-af63-1b78cf6a8723","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.544030Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:f5cc7492e491079e5264035ecdbe44c53ab63a23bf9687377c88a2985e0f2526","observation_id":"3cd9a652-3352-4233-829d-792e61a63944","resolution":{"observed_at":"2026-08-07T10:27:09.340899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.325755Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"ae09af09-98f5-4c44-9619-751253a41aee","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.547308Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:aafcbbd813e7166d3ee80b25d6f2bbe0554bf7243dadd1adec023dc6555fec28","observation_id":"f7c7c1e2-b227-435a-b947-0953c3abe4eb","resolution":{"observed_at":"2026-08-07T10:27:09.330141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T10:27:08.550404Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.550404Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:b8bf3cb3004e008833597b50903c033ec7c849f672b05f0cd8e7bd59bffa79ce","observation_id":"a83c741a-2e47-4567-b496-19a971700bbd","resolution":{"observed_at":"2026-08-07T10:27:08.550404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T10:27:08.553683Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.553683Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:0ea13c39490132c365174da570b28b5c6c2b5399b1dc7bda708d18de67b39263","observation_id":"9578d87c-21c6-4210-923b-26d4dc0c536c","resolution":{"observed_at":"2026-08-07T10:27:08.553683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T10:27:08.556727Z","title":"Oryx mllm: On-demand spatial- temporal understanding at arbitrary resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.556727Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:53f7fbbcfd182d86043d6ad3d80c5cd582abd233b3072bf365d51a24eea44e1c","observation_id":"899732fe-3962-44d9-9f9a-12075b47872f","resolution":{"observed_at":"2026-08-07T10:27:08.556727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.314237Z","title":"Effi- cient inference of vision instruction-following models with elastic cache","venue":null,"work_id":"ccd31aea-dfb3-41ce-b737-852619d64a34","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.559674Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:624e7e0cffcd413695df9ce02e5c75c13eab1c6afd06459844fda4616b6e0201","observation_id":"880c1dff-0c4b-48f9-9bf6-96a0e4d84d16","resolution":{"observed_at":"2026-08-07T10:27:09.318901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:27:08.562512Z","title":"Ola: Pushing the frontiers of omni-modal language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.562512Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:c3fb6033d9bfd03f626aec3da8fdb13e0aeb505210f330cd220091153ebc8012","observation_id":"bf4ec20d-c45d-4fb2-90a6-085f09707196","resolution":{"observed_at":"2026-08-07T10:27:08.562512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T10:27:08.565388Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.565388Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:5045b9c359dc2a17847eea601e34ebe62019e35a7d5a1205ff94e1b658b04ef7","observation_id":"9e4548a8-5541-4013-8f38-477bf4129879","resolution":{"observed_at":"2026-08-07T10:27:08.565388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T10:27:08.568861Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.568861Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:06249887cab3caeeff026cdac9a51cb3c75715e86e8caddd9eb877459b7f3851","observation_id":"e633d34b-836b-43a8-adb4-eb8ea93ab707","resolution":{"observed_at":"2026-08-07T10:27:08.568861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.303127Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"4b77c040-c0f0-40bc-bac4-a2b4152f163d","year":2021},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.572674Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:9968c8b229754576e6758554be35b1b8b18869401e68bf0da37539372b0c8ef2","observation_id":"1c093e96-8433-46a2-ae12-eaae3306a507","resolution":{"observed_at":"2026-08-07T10:27:09.306818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.293050Z","title":"Icdar2019 robust reading challenge on multi-lingual scene text detection and recognition—rrc-mlt-2019","venue":null,"work_id":"281410b3-c95e-4cd7-a849-e3689ba807e2","year":2019},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.575877Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:7a4d625aefd6e1da56368b859ff8e42c798c850c78ba9aa1aa5c9274bb110b8e","observation_id":"d9cf2fbf-4904-4792-a442-a735996fbe93","resolution":{"observed_at":"2026-08-07T10:27:09.296422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.281837Z","title":"Openai gpt-3.5 api","venue":null,"work_id":"074ef5cc-4469-4ee0-8786-095426e140b8","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.578986Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:2763689c7cc63812f14115cf5d08617923cda340e3009d1210a69a56e5a06e44","observation_id":"a6100129-a842-4b65-b044-da096e0eb340","resolution":{"observed_at":"2026-08-07T10:27:09.285401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.265624Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"653b85cf-6e4a-4f79-8722-e0971a7a526a","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.581851Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:457f76bd12a85aeccf459d36a1b8f99c174fbcf452e2e6ae5aa5654672e89cd4","observation_id":"6e54d431-a56a-42c6-a734-97427afd117e","resolution":{"observed_at":"2026-08-07T10:27:09.269553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.253551Z","title":"Hello gpt-4o — openai","venue":null,"work_id":"0db8080b-c1b5-40bf-9e9d-ab0c1da32571","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.584744Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:d4441d2c4bee991bda6cf8d481ac74aee279cf6618bd525beb061fcca7e7ab57","observation_id":"59f5f77e-6697-48bf-8c7f-a9aa61506fd2","resolution":{"observed_at":"2026-08-07T10:27:09.256952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T10:27:08.587561Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.587561Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:0dce9addc8784943ffcb6b9dfa7f67ef244bdf49fc05d77806a61c3b24c0d6ff","observation_id":"db801acc-99f8-4e8d-8389-511d707c6541","resolution":{"observed_at":"2026-08-07T10:27:08.587561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.240506Z","title":"Qwen2-vl: To see the world more clearly","venue":null,"work_id":"6cfb24ca-decf-49d3-96f2-c1002276c0ba","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.590765Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:b48828966c5d0b659d020aa75d033e9f7c7277884fb5adcdec4acd975267af33","observation_id":"26bcdf97-5519-4b34-a50a-92ea65acc44d","resolution":{"observed_at":"2026-08-07T10:27:09.244338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.229821Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"18f22bff-393f-44a6-b7d9-dafaf1a345af","year":2021},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.594024Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:c2b2e251b971f9de7de1847393cbf7d8df547a13e3df73b162424d732bdd84b9","observation_id":"939c2c07-1104-419f-970f-1bad73e39310","resolution":{"observed_at":"2026-08-07T10:27:09.233310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.218055Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":"a5bc2594-aca1-4482-a739-f1c8f96026e4","year":2020},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.597175Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:dadff85c1dc270c21bdf8ff896e0d2642fad9dfc6a59113af61e39db1a2797a4","observation_id":"0489a506-c797-44c8-af9c-9ff845903f67","resolution":{"observed_at":"2026-08-07T10:27:09.222002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.206908Z","title":"Towards vqa models that can read","venue":null,"work_id":"e246ebb8-1619-42d4-8abe-aed86b405742","year":2019},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.599910Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:7d1f52300f50370d605158910c81d870d0159fa8cb905cc643c0ff77f99dada2","observation_id":"6f2a7073-6f3c-4251-b5db-017bc3ff8172","resolution":{"observed_at":"2026-08-07T10:27:09.210343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:08.603979Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.603979Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:82f2a6c744b50b169ac010d8ccd03c4a0190b7a8050cabade9f2fd4eaaac920b","observation_id":"48163766-a825-40a6-b97c-042baceaf8a4","resolution":{"observed_at":"2026-08-07T10:27:08.603979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:08.607076Z","title":"Qwen2.5-vl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.607076Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:2decaf9523f0c0363538e1ece9262e99a6896cd1853262d00cb663e5db94219f","observation_id":"0bb75663-bad7-414c-be79-be02a3ec5560","resolution":{"observed_at":"2026-08-07T10:27:08.607076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T10:27:08.610568Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.610568Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:9195ae89d14523a6aa517e8ce350477d69abb1a4b010c1b9df9243c88664fe62","observation_id":"0b70eac0-5ef7-4e51-b076-1f80beee6f17","resolution":{"observed_at":"2026-08-07T10:27:08.610568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:27:08.614050Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.614050Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:cce7730d67c1c733495084e047b20d68a042414bc01a1db480074904ad8a7c79","observation_id":"55c11c4a-8f90-4ef1-9412-4ffe2239f111","resolution":{"observed_at":"2026-08-07T10:27:08.614050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.179084Z","title":"Attention is all you need","venue":null,"work_id":"d3b75e5a-8194-4d12-9ef1-0fa41c6d01c2","year":2017},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.617520Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:036e90d02a5b6a06841f825a21b3ea0a00e8d8d558ada3b84dc9af7daef86251","observation_id":"4389f7f5-64db-46bb-aade-3da369c6420b","resolution":{"observed_at":"2026-08-07T10:27:09.182854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T10:27:08.621107Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.621107Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:4dcd4f335ee3117a61faa72aa2ab8cb5c2cca9c09387abb90e7d3709a5959754","observation_id":"2a8c20f4-b3a0-4d56-8234-0aa88e43a211","resolution":{"observed_at":"2026-08-07T10:27:08.621107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-07T10:27:08.624340Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.624340Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:d025f4dd0304077e18e0af92b10bcfac14b7c5c8f21429150f5fa274b9373876","observation_id":"a948cb9a-ed4a-49d7-a9c0-9c532f81ba55","resolution":{"observed_at":"2026-08-07T10:27:08.624340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:27:08.627677Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.627677Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:9706c759d19e6ba16eda251b9448a2413dd2f4768761b6fdfcfdb83753fba17d","observation_id":"8a695192-8751-4bbe-a402-e1d30c00b363","resolution":{"observed_at":"2026-08-07T10:27:08.627677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.168066Z","title":"mplug- owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"38b9105a-0ae7-4ccb-ae9e-7e39c49ef792","year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.630668Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:3fc0092fa062985c5cad576efc394643a34e1f318dad877ec5cac8e4ea18f36a","observation_id":"84ec8c9f-a0de-44ff-85f4-0e26332e6a45","resolution":{"observed_at":"2026-08-07T10:27:09.171594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.156214Z","title":"A large chinese text dataset in the wild","venue":null,"work_id":"9a18b179-49a5-40ea-b7ef-7fd43b406269","year":null},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.633733Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:aadfbca41786b097c322547f621d01f547b1373ca0c5aedcb6f983ce634d6651","observation_id":"ddf2ac94-c5c9-4c65-8cd1-2f8063209dec","resolution":{"observed_at":"2026-08-07T10:27:09.159665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.143703Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"d36c1775-0a43-40fd-a7f2-fd43b3d4a358","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.637152Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:91ab6e23c5800a6a15646907bfa32e7b2b7075973b51b6655026d6f8c87f2d75","observation_id":"38f2f6b7-7182-4e57-8b4a-32b8fc3e6976","resolution":{"observed_at":"2026-08-07T10:27:09.148847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:09.129684Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"3a74e2e7-e6df-4ec7-b774-be8682786603","year":2023},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.640131Z"},"links":{"citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:38a6d8a2092f18eb9fcbe95829e2364aec1231864483089a05a7fc0e211d2a4d","observation_id":"6ac57d46-2557-46db-91bc-d5bb35590948","resolution":{"observed_at":"2026-08-07T10:27:09.136099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 4 inbound Pith citation observations for arXiv:2506.05344."}