{"as_of":"2026-08-13T15:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a141cfd773be26228c07587f30bd0fa9a9e49712803cf2719137a80ae22ef7e8","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:27:05.708277Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T22:09:56.270516Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T05:45:56.102421Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-08-11T19:00:42.610450Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:29bb6d7bb5968681ffcd75b417bfa5034a925b18da47e1471aa26a7414280358","observation_id":"9c2be27d-d82f-4e75-b00e-629425ae9f37","resolution":{"observed_at":"2026-05-18T05:45:56.105299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-07-14T22:09:56.270516Z","title":"arXiv preprint arXiv:2506.05328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12703","last_updated":"2026-06-29T17:45:27Z","snapshot_observed_at":"2026-08-06T02:01:46.246977Z","submitted_at":"2026-03-13T06:28:46Z","title":"SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T22:09:56.270516Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2603.12703"},"observation_digest":"sha256:3bb6aba1c9f872bd2fe3f26ae6606f58a0fde5a00947c24e6c7d222dff9c1dad","observation_id":"e3189c56-f1bb-4f92-8354-b7a926ffdf6e","resolution":{"observed_at":"2026-07-14T22:09:56.270516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-11T15:24:09.432999Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:6f2fab845c183f6932332744bdd0ce7975206e0bf1aabb3d8aea2793fe9120a3","observation_id":"e4baaf95-ed9e-476e-b0ff-3904fcbc7312","resolution":{"observed_at":"2026-05-10T12:10:22.142010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:b2fd63e1014a2ee4942495774eea73ed19d631250f16a39f0076594290f6f48b","observation_id":"da73e082-7283-4c33-aaae-e153c39db0af","resolution":{"observed_at":"2026-05-10T09:18:32.125415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T03:49:58.240883Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:1e4096571b89e05cdc0dad8142bf91bd03efea6a6c976080ce352fe599899fe5","observation_id":"11430591-9fb8-4725-9863-066575a13626","resolution":{"observed_at":"2026-05-13T03:52:12.698673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T06:06:20.658030Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:23eb0bc584e56b8827519b230b578872ca1ddb124033fc264414e54ab99c8185","observation_id":"2449202f-3603-4a76-9f9c-6f41ce858e3d","resolution":{"observed_at":"2026-05-15T06:09:50.259437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2506.05328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-08T22:46:15.287802Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:f25bccfdf72c90b26a0c62fe2dc2de19ac03619232cc590208094fcb6bfb5718","observation_id":"15ec56f8-173e-4780-b416-249258d469bf","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05328/citation-record","integrity":"/paper/2506.05328/integrity","json":"/paper/2506.05328/citation-record.json","paper":"/paper/2506.05328"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T10:27:05.464312Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.464312Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0ee7e39167ba51144bb8aa6b5b341f31755c18fd15d021b4dda54322e34f42a3","observation_id":"a684ffce-ddae-4dfa-b02a-13da027d9496","resolution":{"observed_at":"2026-08-07T10:27:05.464312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:27:05.468595Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.468595Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:de32215fbe99609202f3dfa039005a835953c20fceb9622004a594d7b126c848","observation_id":"6be6bd9a-0430-44a7-9f86-3859b73daa87","resolution":{"observed_at":"2026-08-07T10:27:05.468595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.471940Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models.arXiv preprint arXiv:2504.15271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.471940Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:2208840cc1457ac5c132e9189045eba0706133a833a74788477333826c3b01a9","observation_id":"22c657ba-6fc6-4910-9e5a-f65fe28c6634","resolution":{"observed_at":"2026-08-07T10:27:05.471940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T10:27:05.475164Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.475164Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:756826a9d36deaa851ea6311ff552abb3d5f29dcc3a1aa71058f363d33e4d307","observation_id":"e2307a22-5132-418a-bd8d-d6bf2f3373d7","resolution":{"observed_at":"2026-08-07T10:27:05.475164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.562506Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"382e3845-bbbd-4b26-be08-0b0b94c76db8","year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.478496Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:8fb77cba28f7b040a4b77ebdf036fe2b30b0d533f506ae155174d0330b51ad90","observation_id":"77bb1d4b-203d-486f-8adf-71fbb007e644","resolution":{"observed_at":"2026-08-07T10:27:06.565887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T10:27:05.482122Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.482122Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:61ab98194ae104beef95b07a91609dd0f434ae893eb7730e521be26926dc1cc5","observation_id":"aec4a5df-6f37-466a-955a-a43cfada4361","resolution":{"observed_at":"2026-08-07T10:27:05.482122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:27:05.486127Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.486127Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1119220c0da29efc0c285da5e29f4e54a8fa8163cdf764e21dde8ae459028712","observation_id":"e816cc37-4f83-46ff-b32a-26b4eaafe715","resolution":{"observed_at":"2026-08-07T10:27:05.486127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T10:27:05.489310Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.489310Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:dcbbfa3388539c8bdaf5d7f0a67e768cef52b3cebc0f847764063c0ee9bfc39e","observation_id":"dbda99d1-540f-4f58-b15b-70c985135e06","resolution":{"observed_at":"2026-08-07T10:27:05.489310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T10:27:05.492480Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.492480Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4294ffb49c632c543b3f74490de7f4ecbaa368079cbf7105a12dcb068f3fe7da","observation_id":"fbd5d1e7-aff8-4073-980f-3d9d450d7a83","resolution":{"observed_at":"2026-08-07T10:27:05.492480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T10:27:05.495697Z","title":"Internvideo: General video foundation models via generative and discriminative learning.CoRR, abs/2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.495697Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:da78d4a5be18228ab929466aa9a6d38755041e55164966e95edee3bb27763943","observation_id":"0ba4e3ee-4df0-48c8-b7f6-ca213a40175a","resolution":{"observed_at":"2026-08-07T10:27:05.495697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-13T00:47:41.087976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T10:27:05.499105Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding.arXiv preprint arXiv:2403.15377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.499105Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1e6148e8c441b8f65524344fcac79544c6be081375d709604155edb7334aa5a6","observation_id":"5c096c6d-ac30-465c-a225-b79619168202","resolution":{"observed_at":"2026-08-07T10:27:05.499105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.502419Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.502419Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:a50d38740f01e94a3778df643bb0c90134d99eb77c0295447f99fda19fc71cde","observation_id":"09444582-a7b0-46d5-9633-3341ba5b0202","resolution":{"observed_at":"2026-08-07T10:27:05.502419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:27:05.505880Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.505880Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:8a44c0e58b30d8d2c3d1008d6e94721dc09de6aaf2a0e34aefe98076b6784d92","observation_id":"46c9b6b1-1bdf-47dc-9e13-ea4ac9dc1f34","resolution":{"observed_at":"2026-08-07T10:27:05.505880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-13T11:37:00.458654Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T10:27:05.509262Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.509262Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4b1a6514a73e85f61bb138e8963a956cad02143e2e1ef7938f0ec057fdeaefec","observation_id":"5e2d9d77-a5ee-42a6-8377-2f5e94b38832","resolution":{"observed_at":"2026-08-07T10:27:05.509262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17085","last_updated":"2024-07-24T08:22:49Z","snapshot_observed_at":"2026-08-12T23:15:51.029541Z","submitted_at":"2024-07-24T08:22:49Z","title":"OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17085","snapshot_observed_at":"2026-08-07T10:27:05.512719Z","title":"Ovr: A dataset for open vocabulary temporal repetition counting in videos.arXiv preprint arXiv:2407.17085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.512719Z"},"links":{"cited_paper":"/paper/2407.17085","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:526d9072aa7df450e557c492f096c7c4c4e27b0565e7adf7de9c513d2083a971","observation_id":"5e625726-1323-43d1-b2b6-16c47c50e13f","resolution":{"observed_at":"2026-08-07T10:27:05.512719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.545477Z","title":"Dvd-counting, 2025","venue":null,"work_id":"a35d6f84-069c-4144-936d-8e9146b3f485","year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.516090Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:57256ee2eb313822b8909987daaca2c9718e707b6d82353add3e806e047bde66","observation_id":"300bb223-9ce7-44fe-9ffb-674a621388d9","resolution":{"observed_at":"2026-08-07T10:27:06.548934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.519281Z","title":"Counting out time: Class agnostic video repetition counting in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.519281Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:725db439387ef339ce8f3d9b76a0cd9f4a5e631657cea39f9cc19dd229e700b6","observation_id":"3a54d292-f766-44d4-a434-7cda7ddb0235","resolution":{"observed_at":"2026-08-07T10:27:05.519281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.529684Z","title":"Repetitive activity counting by sight and sound","venue":null,"work_id":"11646b16-49ff-4c87-bdf2-469efc291304","year":2021},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.522916Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:e2e1d107b6d56a512955bfe612dafcdb2155a03c1838b77cb7afc9c3665987e4","observation_id":"3fdb8348-6f9e-4a57-b55f-82e31989d5c2","resolution":{"observed_at":"2026-08-07T10:27:06.532936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01018","last_updated":"2022-04-03T07:50:18Z","snapshot_observed_at":"2026-08-10T07:58:54.143158Z","submitted_at":"2022-04-03T07:50:18Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01018","snapshot_observed_at":"2026-08-07T10:27:05.526108Z","title":"Transrac: Encoding multi-scale temporal correlation with transformers for repetitive action counting.arXiv preprint arXiv:2204.01018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.526108Z"},"links":{"cited_paper":"/paper/2204.01018","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:dedecdcab2e67da1349f2ae5c26d4313df76d102c5604a9c674f21b0baad51d9","observation_id":"771c62c1-f2e7-4a53-aedc-b111cfc00a7f","resolution":{"observed_at":"2026-08-07T10:27:05.526108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-13T05:16:24.913588Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-07T10:27:05.529740Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding.arXiv preprint arXiv:2412.12075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.529740Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:20866ede69633988bdd10ddb3af8dd9d0f61b5acb977914aeb64aed33644ba97","observation_id":"02223deb-a7f6-4379-8ff1-a37f4262b12d","resolution":{"observed_at":"2026-08-07T10:27:05.529740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:27:05.533023Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.533023Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:9880ca3437c592cf8def0fa997a27ef3bb24ac0c0d09b834c5bd259c6bb7ae6d","observation_id":"be396407-bbd2-4d64-bb62-6ae72aab8163","resolution":{"observed_at":"2026-08-07T10:27:05.533023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:27:05.536387Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.536387Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:441cb567118e99151d47c5016979108ff68d7acf8346cb79b65d5712ec6d56c7","observation_id":"806f6ff7-5b7b-4842-9630-86556c9f42b7","resolution":{"observed_at":"2026-08-07T10:27:05.536387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.539317Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey.Journal of Machine Learning Research, 21(181):1–50, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.539317Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0f85fcd63f8a526ed335e9fc3005c8da0a241fbe8a2f08d4754ce3e273b9ecf3","observation_id":"d411759c-8069-4827-b3b0-eabe637af90a","resolution":{"observed_at":"2026-08-07T10:27:05.539317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-08-13T04:15:20.480186Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T10:27:05.542467Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.542467Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:7e01c80ab5495c5b617c5358edfc78126bf2b66366d37cca17fe2dfcc75f8841","observation_id":"c7b9bcc2-ec63-4c1a-b970-4323e5492402","resolution":{"observed_at":"2026-08-07T10:27:05.542467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.545846Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.545846Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:c9b78b0016eafc0b7f7d6f3c8ee2b7d68c3bcaeab723922dcc250114d7e00e34","observation_id":"9e0e43b2-8ea1-4d4b-9536-cd3afc7f67f2","resolution":{"observed_at":"2026-08-07T10:27:05.545846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-08-12T22:23:10.507095Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-07T10:27:05.549332Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities.arXiv preprint arXiv:2410.11190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.549332Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:e0d33e471e5e6ba98f6a080baf6b114e03357ef6494420943187aebc84ac7814","observation_id":"686c5244-6f31-443a-a4b1-34f22aab81aa","resolution":{"observed_at":"2026-08-07T10:27:05.549332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12109","last_updated":"2024-10-15T23:16:28Z","snapshot_observed_at":"2026-08-12T22:22:18.834008Z","submitted_at":"2024-10-15T23:16:28Z","title":"OMCAT: Omni Context Aware Transformer","version":1},"cited_work":{"arxiv_id":"2410.12109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12109","snapshot_observed_at":"2026-08-07T10:27:06.043077Z","title":"OMCAT: Omni Context Aware Transformer","venue":"cs.CL","work_id":"20e71dea-59cc-448a-b234-70200137bd8a","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.553172Z"},"links":{"cited_paper":"/paper/2410.12109","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:673df1c8308622aaae10af143d71f9d9b47da0deab353fec2e22c15f67062e96","observation_id":"addbeab7-af44-472e-9131-91bcf2215c69","resolution":{"observed_at":"2026-08-07T10:27:06.046811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.557034Z","title":"Baichuan-omni-1.5 technical report.arXiv preprint arXiv:2501.15368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.557034Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:16068bfe08f2ead03db14b63db4bb27775b90af22db2cc92397c63e7b31cdfcf","observation_id":"9ca97b63-d6e3-4293-87f8-684f8ed388ba","resolution":{"observed_at":"2026-08-07T10:27:05.557034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13068","last_updated":"2025-03-17T11:19:03Z","snapshot_observed_at":"2026-08-07T16:58:15.380194Z","submitted_at":"2025-03-17T11:19:03Z","title":"Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13068","snapshot_observed_at":"2026-08-07T10:27:05.560273Z","title":"Crab: A unified audio-visual scene understanding model with explicit cooperation.arXiv preprint arXiv:2503.13068, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.560273Z"},"links":{"cited_paper":"/paper/2503.13068","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:bf078cecc25e2765e8cadcf575747a639fd6ba033eada8d8e09342780636f229","observation_id":"18af2022-4246-4367-be8f-081bb7661fe2","resolution":{"observed_at":"2026-08-07T10:27:05.560273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-08-12T23:37:09.264651Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T10:27:05.563770Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.563770Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:9944c48fcd7a936341d66d499cfe700aacee18825537425293ce9d7767fc068e","observation_id":"3a2e00d1-6dff-4ecc-9867-4cf0fc9abd08","resolution":{"observed_at":"2026-08-07T10:27:05.563770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.567346Z","title":"Meerkat: Audio-visual large language model for grounding in space and time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.567346Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:155a4189d71c2eb1ef2076fbe2a950525f19e3d8c5a477fb7defd3287a270828","observation_id":"5ecc1de9-e393-4d1f-bf8e-82aeb980cc0d","resolution":{"observed_at":"2026-08-07T10:27:05.567346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19794","last_updated":"2025-03-25T16:02:37Z","snapshot_observed_at":"2026-08-09T05:15:09.906198Z","submitted_at":"2025-03-25T16:02:37Z","title":"PAVE: Patching and Adapting Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.19794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.19794","snapshot_observed_at":"2026-08-07T10:27:05.974991Z","title":"PAVE: Patching and Adapting Video Large Language Models","venue":"cs.CV","work_id":"34f711c3-d337-4ed8-b10c-fbce3dd2b896","year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.570467Z"},"links":{"cited_paper":"/paper/2503.19794","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4f5bed022f1239904f57c20409b6f179a219a6ee58ac141e2f4a5fb7f9a80ba8","observation_id":"e178f6d4-3cc7-4795-9423-6e16a9a8f312","resolution":{"observed_at":"2026-08-07T10:27:05.978456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-12T23:43:20.234350Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-07T10:27:05.574186Z","title":"Needle in a video haystack: A scalable synthetic evaluator for video mllms.arXiv preprint arXiv:2406.09367, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.574186Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:a486affecdf7b9cd73f07acc9703a35c694943bdc1b70f4da2b2d291717bf0bd","observation_id":"bf31b9ad-6fc1-401a-be87-937002b6cf52","resolution":{"observed_at":"2026-08-07T10:27:05.574186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.500574Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"a3e19006-649d-47b3-986c-1c13decec32d","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.578385Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:7abb9ec1cfc76cd76c544acf4ad797fadde7af690e2b2db42eb2bf7e8e0726ee","observation_id":"c6254dd5-267a-4a5b-a5c4-fc16f2043bbb","resolution":{"observed_at":"2026-08-07T10:27:06.503625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-08-12T16:10:35.170069Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-07T10:27:05.581493Z","title":"Worldsense: Evaluat- ing real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.581493Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:688857cb5c968d2dbeabd9bc479a1106b5e93491340b210273893459bb0bdeaa","observation_id":"84bd407e-a595-4e5a-a0a5-5fa754d236f5","resolution":{"observed_at":"2026-08-07T10:27:05.581493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.584562Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.584562Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:72fe9eee6871cfade6735a88bea1713f2aac0970ed36ae7ec01436c96f3e63b9","observation_id":"0b61ec07-d356-4e35-894e-09aab9193737","resolution":{"observed_at":"2026-08-07T10:27:05.584562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T10:27:05.587891Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.587891Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4ea76cece8376430e804f44f855c1cf2b0125bb13bf2285818a0cde9c07fcc04","observation_id":"34bc1aaf-6807-4143-893e-f983d1033b79","resolution":{"observed_at":"2026-08-07T10:27:05.587891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T10:27:05.591545Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.591545Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:53dc5ae9e0b57aa52e3ef017c1ce051986f5a399d5257c501818356390229339","observation_id":"7d06622a-75a5-4ce8-a4ce-e48d40e83409","resolution":{"observed_at":"2026-08-07T10:27:05.591545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T10:27:05.594716Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.594716Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5a2a4130673f47f97097f25ff598d3cb51bc471dc2a22ce34463de28a268513d","observation_id":"79e302ca-b92a-4cb5-9391-af5c5397bfa4","resolution":{"observed_at":"2026-08-07T10:27:05.594716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T10:27:05.598090Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.598090Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4773de9fc7345f676af69c427c418b1128d8586ac97c7a66ea85ea22f317cbca","observation_id":"8debd7c1-08a0-4b71-8179-253c635383c6","resolution":{"observed_at":"2026-08-07T10:27:05.598090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.484120Z","title":"Introducing gpt-4.1 in the api, 2025","venue":null,"work_id":"f568c192-da07-43ee-8f73-3b3f7dc4726e","year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.601374Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:28aa33dc62d2fe5a1bc8d28d9bed98c6eec92028ca0ddcb49d53646445d2b089","observation_id":"6435e326-212d-41e0-b84e-7df8a253e2bb","resolution":{"observed_at":"2026-08-07T10:27:06.487558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:27:05.604689Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.604689Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:c121a3517350565181d776c8b55a5112222e7c55135c4c68ea633185b88b2699","observation_id":"6d514cce-0015-4127-85dc-032e853a8a3c","resolution":{"observed_at":"2026-08-07T10:27:05.604689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T10:27:05.608221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.608221Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:3f25e4bff47ec0e913b094627bb55d735d497a36029f52b4988dc26b75c895bc","observation_id":"2d5d455d-553e-4098-aa0f-ffc0607bc6b7","resolution":{"observed_at":"2026-08-07T10:27:05.608221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-07T10:27:05.611836Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models.arXiv preprint arXiv:2501.14818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.611836Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1d581c90e630449f198f161a82a9456688ebf82022f139aa6ac88580d7ae95da","observation_id":"8ee657c0-142e-46e5-abb7-0f73ee36fc1f","resolution":{"observed_at":"2026-08-07T10:27:05.611836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T10:27:05.618482Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling.arXiv preprint arXiv:2501.12386, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.618482Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ab3dee21f25732a7d0a630ceed1ce6d73a02661e076fc31c62c9fac120968fad","observation_id":"8cf9e3ab-02f8-44a7-a346-1c46941f6bbd","resolution":{"observed_at":"2026-08-07T10:27:05.618482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T10:27:05.621901Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling.arXiv preprint arXiv:2501.00574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.621901Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ce7cc3194a7584516ccfa2f16ce3092bcd2e9a67964c1e42edd69c308e908e32","observation_id":"1746ded8-6795-49d0-871f-472260bf428f","resolution":{"observed_at":"2026-08-07T10:27:05.621901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T10:27:05.625899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.625899Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ba0e2655e28d8e5d1eb982ff0d73dd135affc0043b80b120f42ac846781332be","observation_id":"dc908336-520b-4e60-8078-7f6460e1aaf8","resolution":{"observed_at":"2026-08-07T10:27:05.625899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.629557Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.629557Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ace3a1a172d9d1142d0a5ac68e273e987b9be014eb6e4b8cea69e3a7b6303d5b","observation_id":"27005343-43db-4f9d-864c-8a8fd57809ca","resolution":{"observed_at":"2026-08-07T10:27:05.629557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.633066Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.633066Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:f10a52a02769f367aeeefea88444475852934a1912d237a22a5ce382ec3512c2","observation_id":"5a2c7e4d-0bfa-46c4-be84-db3f5867773a","resolution":{"observed_at":"2026-08-07T10:27:05.633066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.460438Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"5454879f-e276-4dc2-9612-68a67ab1e0b4","year":2018},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.636748Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:a81edc8d300bfa73348e0f100428ad59c08f56bc25163fc224634c7dd7119cca","observation_id":"872115b7-75bf-42ad-94ca-e787115101ca","resolution":{"observed_at":"2026-08-07T10:27:06.463851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.450422Z","title":"Dense-localizing audio-visual events in untrimmed videos: A large-scale benchmark and baseline","venue":null,"work_id":"62e02810-4677-410d-92c5-081f79bb8ae3","year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.639954Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:b93dccde8b60610c89bafef4b1b8cda765fde76477274cc22c6015ba84b8589d","observation_id":"2fcdf031-2400-4683-a35c-832a7b127ab2","resolution":{"observed_at":"2026-08-07T10:27:06.453872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04598","last_updated":"2021-06-21T10:56:29Z","snapshot_observed_at":"2026-08-08T18:03:47.542581Z","submitted_at":"2021-04-03T07:07:21Z","title":"Cross-Modal learning for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2104.04598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.04598","snapshot_observed_at":"2026-08-07T10:27:05.822980Z","title":"Cross-Modal learning for Audio-Visual Video Parsing","venue":"cs.SD","work_id":"2593efd4-564f-4bb6-a287-9add728d504e","year":2021},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.643589Z"},"links":{"cited_paper":"/paper/2104.04598","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:291b19d2ed9ac0642aa1fe14bed276f7910f69915872961996cd3af0339e4a85","observation_id":"3ad08ab3-41c1-486e-8ab4-6402bbae9db1","resolution":{"observed_at":"2026-08-07T10:27:05.828372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.439951Z","title":"Audio-visual segmentation with semantics.International Journal of Computer Vision, pages 1–21, 2024","venue":null,"work_id":"6a0d00a4-82a9-43eb-9cab-a13f0121d686","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.647139Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:85161d7938013ff629372785dda0d9cfdddee9008fed1d45118d5c444448f544","observation_id":"fe57144d-5fa1-42e1-8c75-b318be294a27","resolution":{"observed_at":"2026-08-07T10:27:06.443673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.430018Z","title":"Enhancing geometric factors in model learning and inference for object detection and instance segmentation.IEEE transactions on cybernetics, 52(8):8574–8586, 2021","venue":null,"work_id":"8078d56a-bfd1-4861-8f2a-5f92b70c5c3c","year":2021},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.650416Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:148a97babd4ab5fcd7dd5ba6c21a90893575b15596956ed9f660886ff182810d","observation_id":"100a54ff-3995-45cd-b92f-440fe0f4a08f","resolution":{"observed_at":"2026-08-07T10:27:06.433369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.420471Z","title":"URL https: //www-cdn.anthropic.com/de8ba9b01c9ab7cbabf5c33b80b7bbc618857627/Model_ Card_Claude_3.pdf","venue":null,"work_id":"d9682421-b530-43de-910a-39550d3de4bf","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.653489Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:7bcea2ef97bfb93cd13318835c999ffed1d070b1c95e9ed4ca1f4de88a8570db","observation_id":"cc351f6b-87d6-47af-a2fa-68c710048516","resolution":{"observed_at":"2026-08-07T10:27:06.423501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.657817Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.657817Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ee30ddab154f1a2050b747163fdcdd9bb09c47c912581272c183ad394c4347bc","observation_id":"ab692d4d-79fa-40b9-b859-571f1388fd5e","resolution":{"observed_at":"2026-08-07T10:27:05.657817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-08-13T04:44:24.786629Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-07T10:27:05.661256Z","title":"Groundinggpt: Language enhanced multi-modal grounding model.arXiv preprint arXiv:2401.06071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.661256Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:54c3acabb380f33a98d3f32ea2df6ffce89d8cfa04c27e937160d893a6dd5193","observation_id":"71987732-166b-49b7-b8f0-00bddd142d99","resolution":{"observed_at":"2026-08-07T10:27:05.661256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.404083Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"f303cb94-ed8f-408a-911f-61e571bf7c1a","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.664610Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:bf64563a5dfe3c8981ff5bfdb62ec98b326be3c33bbb167010a51f7ecc2b7ac5","observation_id":"6005d5e9-493a-467d-9ed5-a8d3c08c7d5d","resolution":{"observed_at":"2026-08-07T10:27:06.407310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.394289Z","title":"X-instructblip: A framework for aligning image, 3d, audio, video to llms and its emergent cross-modal reasoning","venue":null,"work_id":"1536f6ab-5173-41d2-a306-67a51618d84f","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.667783Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:66237a7cd8171de08261938f21bd521f7491b60ea6179b6ff6bff80d8b869a26","observation_id":"a29cf447-a518-4291-b3eb-d092abc80390","resolution":{"observed_at":"2026-08-07T10:27:06.397918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.383860Z","title":"Avicuna: Audio-visual llm with interleaver and context-boundary alignment for temporal referential dialogue.arXiv e-prints, pages arXiv–2403, 2024","venue":null,"work_id":"2cdd65f9-d519-4d55-87c6-c2c4e9d24ede","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.670950Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4abd2b3a52d5254a640ebc7b72b7eaaa12e1ceab7fa1cf05506d4567127badc6","observation_id":"c550d55b-4f9b-4f2d-89a0-50e4a988721a","resolution":{"observed_at":"2026-08-07T10:27:06.387217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02611","last_updated":"2024-12-03T17:41:23Z","snapshot_observed_at":"2026-08-12T22:01:30.893731Z","submitted_at":"2024-12-03T17:41:23Z","title":"AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02611","snapshot_observed_at":"2026-08-07T10:27:05.674331Z","title":"Av-odyssey bench: Can your multimodal llms really understand audio-visual information?arXiv preprint arXiv:2412.02611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.674331Z"},"links":{"cited_paper":"/paper/2412.02611","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:98932448f38ac7651d88fbafea29257f1cc051c0723d334c43a4374479e86cd1","observation_id":"484f6ce8-fdd9-4447-b52b-7e1f6f78b46d","resolution":{"observed_at":"2026-08-07T10:27:05.674331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.677898Z","title":"Omnibench: Towards the future of universal omni-language models.arXiv preprint arXiv:2409.15272, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.677898Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:04a4fd04061bb24ff3e54b6477453fb9c7cb830d68b966fd696d8e88a32b19c7","observation_id":"0b5835ec-d2b5-4b49-8558-da2721948a9c","resolution":{"observed_at":"2026-08-07T10:27:05.677898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:27:05.680865Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.680865Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:91d2f0d8279790121f101c2b606c63ac19f1fda70dd8eef418e21e8524e14381","observation_id":"5dc4b245-3c20-459a-9398-0aedc32eeaa4","resolution":{"observed_at":"2026-08-07T10:27:05.680865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.374062Z","title":"How many people spoke in the scene showing the conference table?","venue":null,"work_id":"f6c54fb4-3e5c-4c2c-9c51-85846839454e","year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.684003Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:efa7c609f8dcbe012cc8cac03d1376b11d07b4c70b56278ba189e7466cbd9f8e","observation_id":"0b62d6ce-670d-4aac-9cc7-e14526b3520e","resolution":{"observed_at":"2026-08-07T10:27:06.377743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.364520Z","title":null,"venue":null,"work_id":"33c34238-e8a1-4c57-9fac-571d737a6bca","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.687707Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5c78477d813a27a24614f915c824a63159f5c4143c73d2390e96ad38a6cb366e","observation_id":"b2e7becb-f94b-4077-a055-9a04c361c860","resolution":{"observed_at":"2026-08-07T10:27:06.367572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.354322Z","title":null,"venue":null,"work_id":"dcb21f00-aa9e-4236-9d09-8d9314660e3d","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.691318Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:c0cfab58294d5076bea7b613dd06f1a2536920f62a03eb95de91d89e2a8e67c6","observation_id":"466bba4f-c527-4377-93ee-848320097d79","resolution":{"observed_at":"2026-08-07T10:27:06.357940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.344885Z","title":null,"venue":null,"work_id":"9a5615a5-1373-49ea-b99e-2e0d1cb3e4a9","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.694655Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:215ffc5b0caa6aa4b503a39fe645b3f8811a2dcb87d3da0d8d247ecc9303cf09","observation_id":"6181835e-8342-4651-8f75-1f781fa56004","resolution":{"observed_at":"2026-08-07T10:27:06.347782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.335746Z","title":null,"venue":null,"work_id":"80867a7e-7f67-4d45-ae57-83c6bbf6d344","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.697979Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0ae10498baaef7bb392ec39b00372d6f8155153b69fe8061bd23e27b6d05bed1","observation_id":"24fcc273-cade-443a-a195-8b8c300f5146","resolution":{"observed_at":"2026-08-07T10:27:06.338960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.325746Z","title":null,"venue":null,"work_id":"ba044a5e-4109-4ab3-8248-8b564630d18b","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.701456Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:f8953c0de8888775f4f8317f056b70f5da2c9bf19459ad91dd060e97cbea3cde","observation_id":"4cc85d94-89fc-4989-bc42-0e2dc4b9a040","resolution":{"observed_at":"2026-08-07T10:27:06.328979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.316436Z","title":null,"venue":null,"work_id":"19df56b9-2ea1-40ea-9125-c503b1374037","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.705052Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5182a2b2f667e3fffefdb5a8839774e6dbbccd1e5138d7d5d57294a11402a8f9","observation_id":"30856085-49c4-4a07-912b-1ea40b179069","resolution":{"observed_at":"2026-08-07T10:27:06.319383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.306530Z","title":"question","venue":null,"work_id":"bcb9aa54-4131-4cfd-8821-3e7ef0671c8d","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.708277Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:f41748e6d6b9c56d4b90a120815e8ff1b5af065be99c3035f499022538682617","observation_id":"476f044f-235e-4f69-b4dd-82d77e9b3a79","resolution":{"observed_at":"2026-08-07T10:27:06.309524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 7 inbound Pith citation observations for arXiv:2506.05328."}