{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efcf6922796aa4748c6f588c53cbb811f6b68708d1a8d324920d002504708d55","coverage":[{"denominator":127,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:53.545730Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:05.001058Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:22:34.453758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-08-06T22:41:05.001058Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.001058Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:b8ba62f348532ce6ce4a33edafe3e130b71d6a7944352ecbfca0aacaf6793922","observation_id":"b7e657f6-9660-4ad7-a8ed-513e02acdef8","resolution":{"observed_at":"2026-08-06T22:41:05.001058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":"2506.07016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-06-28T19:22:34.453758Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":"a88798e2-13cf-46c6-a1e2-2046f9e2c31d","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-02T05:18:20.195131Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:7becb49e1a0ea405b160a010bba0678e8f8083a11ff45f037488e78b2e03637a","observation_id":"dbe2db90-2cb4-4672-b286-ff4a14a70b56","resolution":{"observed_at":"2026-05-15T21:46:42.485110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":"2506.07016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-06-28T19:22:34.453758Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":"a88798e2-13cf-46c6-a1e2-2046f9e2c31d","year":2025},"citing_paper":{"arxiv_id":"2606.00592","last_updated":"2026-05-30T07:44:52Z","snapshot_observed_at":"2026-08-02T05:52:22.485746Z","submitted_at":"2026-05-30T07:44:52Z","title":"Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:19:09.199731Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2606.00592"},"observation_digest":"sha256:55d3accddd59f5adc28ca8e025ed192e4b705d8bead05e7d3853b00da514bf80","observation_id":"ea59bb54-f6e6-48c1-b475-63155e155898","resolution":{"observed_at":"2026-06-28T19:22:34.455260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07016/citation-record","integrity":"/paper/2506.07016/integrity","json":"/paper/2506.07016/citation-record.json","paper":"/paper/2506.07016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.13068","last_updated":"2025-03-17T11:19:03Z","snapshot_observed_at":"2026-08-07T16:58:15.380194Z","submitted_at":"2025-03-17T11:19:03Z","title":"Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation","version":1},"cited_work":{"arxiv_id":"2503.13068","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13068","snapshot_observed_at":"2026-08-07T05:49:54.266142Z","title":"Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation","venue":"cs.CV","work_id":"cc5d08c3-8694-4a65-9989-da9f40af3197","year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.235638Z"},"links":{"cited_paper":"/paper/2503.13068","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4efa23dc7c3e82b1bc12e93b684eed75a19fd9cb1e8ff183c22b28fd437cbd6f","observation_id":"c9c349f6-6edd-46a0-bdcb-665277de79c7","resolution":{"observed_at":"2026-08-07T05:49:54.269852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.239537Z","title":"Meerkat: Audio-visual large language model for grounding in space and time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.239537Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:fb0905a5dd91925fde51df8f177212fa7f41f0479349c2dcda47ea00ed61f291","observation_id":"ae26d71d-10cd-4f1b-987c-f9fc48a03f20","resolution":{"observed_at":"2026-08-07T05:49:53.239537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T05:49:53.242431Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.242431Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5689ebd4b498669918aee1a7d712207368f5c6635b88a0420626fe695f9e9775","observation_id":"6fbb984b-5ef9-49ec-abb0-41193774fd76","resolution":{"observed_at":"2026-08-07T05:49:53.242431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.245607Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.245607Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4915b9f9845f9eb42c14ea0f0ded5b3304926cee5eccc0b4da34c52d0ec404a4","observation_id":"9281e5fc-12a0-44b1-b467-6ee8a1b32bbc","resolution":{"observed_at":"2026-08-07T05:49:53.245607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05889","last_updated":"2025-03-20T02:27:50Z","snapshot_observed_at":"2026-08-09T20:13:42.662327Z","submitted_at":"2024-02-08T18:27:22Z","title":"CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05889","snapshot_observed_at":"2026-08-07T05:49:53.248569Z","title":"Crema: Generalizable and efficient video-language reasoning via multimodal modular fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.248569Z"},"links":{"cited_paper":"/paper/2402.05889","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ab6f7bf25f647bac19322fcec54dd5d8cab0d16f3c8c67f6196cfa4212e25610","observation_id":"cb2ada9f-3ebe-453f-974a-ce660e33b6ce","resolution":{"observed_at":"2026-08-07T05:49:53.248569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.251727Z","title":"Avicuna: Audio-visual llm with interleaver and context-boundary alignment for temporal referential dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.251727Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ec5b592069dbc52d751aaa52da4ec60a2a4e1455aa3d10984e45b8fa5ecaf9fc","observation_id":"07fa958e-1721-4972-a904-1b52d70a42c5","resolution":{"observed_at":"2026-08-07T05:49:53.251727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T05:49:53.267029Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.267029Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b049e549f17711ebe5e65242f6ce21d6c6bb57b2a228e15f95fc283e1449d993","observation_id":"2aa1aa53-cd40-479c-b381-cab4192fa0bd","resolution":{"observed_at":"2026-08-07T05:49:53.267029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.270357Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.270357Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:29bb9fd370d6ef276f16d554721e21ae300bf1b42091ba4d2f84b82d9bfbac77","observation_id":"ffb5b741-b0a6-47a7-9850-a1b6c96facdf","resolution":{"observed_at":"2026-08-07T05:49:53.270357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-07T05:49:53.273176Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.273176Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:80ab0dc55aefae8223c6a5534dee5248841429a38ef1b52fb5b65d57494dfdaf","observation_id":"a55a95d4-5a08-4bdb-a540-3c8398416327","resolution":{"observed_at":"2026-08-07T05:49:53.273176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.279518Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.279518Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:2727cc12fc4487bffd57d908e0cdb4611ba3e2eb162d32e9b03d7d89938ac6c6","observation_id":"b68cb8c7-9fec-421a-85ad-614890e1b7d6","resolution":{"observed_at":"2026-08-07T05:49:53.279518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.281960Z","title":"Dense-localizing audio-visual events in untrimmed videos: A large-scale benchmark and baseline","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.281960Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b74027b7b81ee851e00d0dcceead1f799c36de55e70c42a76bda7425ded5e4e4","observation_id":"0642fdb3-3293-452d-aace-d241ec4e6a73","resolution":{"observed_at":"2026-08-07T05:49:53.281960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.284473Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.284473Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:179e62210d1ce14a1b1e2ddbf91c49e590867b4411340f42b60d0b95141fc680","observation_id":"28cd0823-f30f-498c-9861-143eb3a8bc9f","resolution":{"observed_at":"2026-08-07T05:49:53.284473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.287137Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.287137Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3281cc0f45c7b8ca37bd8ce56b76b83582a2a98e4313c186d13e56390004f642","observation_id":"2f204c4f-25e5-4659-bdd6-a4b9f95b604a","resolution":{"observed_at":"2026-08-07T05:49:53.287137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.290455Z","title":"Cat: Enhancing multimodal large language model to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.290455Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:6dee413374fbcdc206d32224112e43e861e3a5d05c5e74f1cff687ec6b4a1a5a","observation_id":"e8a4da05-4271-4769-9f0e-d9b74fa231d7","resolution":{"observed_at":"2026-08-07T05:49:53.290455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.293237Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.293237Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:de49e854f57b449893eb9847ec425f364ae715cd0e324cbf0fc05765e3581c4e","observation_id":"86e2d76f-14bd-411b-a289-923b64fd4cb2","resolution":{"observed_at":"2026-08-07T05:49:53.293237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.296583Z","title":"Vggsound: A large-scale audio- visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.296583Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3a666f6876e02ccf448807b10c1f749eafc75dd36bc0330318857f837310b5b4","observation_id":"2b52dfc9-6683-4c2b-abb7-c81cab78b27a","resolution":{"observed_at":"2026-08-07T05:49:53.296583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16213","last_updated":"2024-12-10T19:43:46Z","snapshot_observed_at":"2026-07-06T19:56:25.704753Z","submitted_at":"2024-11-25T09:22:13Z","title":"SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context","version":2},"cited_work":{"arxiv_id":"2411.16213","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16213","snapshot_observed_at":"2026-08-07T05:49:54.210292Z","title":"SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context","venue":"cs.CV","work_id":"b0bc7851-a635-48f1-9ebe-8571f58d075c","year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.299116Z"},"links":{"cited_paper":"/paper/2411.16213","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4aee186a22561a38af0f6c0146e59e34f7a8410cd2500214342cc4ce1d4376a7","observation_id":"74a42b6f-062f-4581-8e7b-74b0436b721c","resolution":{"observed_at":"2026-08-07T05:49:54.215338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.302017Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.302017Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:444cee764f766fb3a2f2b0430a8c67855ac3b605f6ac2b80c9f1c4c594d3f0e9","observation_id":"9743a3e4-b48c-45de-a516-1a9cbe36c5de","resolution":{"observed_at":"2026-08-07T05:49:53.302017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.305234Z","title":"Gemini: Google’s multimodal ai model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.305234Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:fea615b5eae7576afefaa6a3611a02f48b26815428ff2d9435d6372d233a7291","observation_id":"fd4a3517-5586-4f10-a753-2a6c64bfd37b","resolution":{"observed_at":"2026-08-07T05:49:53.305234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:49:53.307666Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.307666Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0522dfd5119d2669feb434017921df394e0abd4057e7e6804b4d819a90f9ab99","observation_id":"14d0b676-6f3f-4568-95a6-a122675a9208","resolution":{"observed_at":"2026-08-07T05:49:53.307666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:49:53.310525Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.310525Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:09daa22a867a211cd13441c51e3f5145ee25ece0fc326fb4633ad1c77c374f05","observation_id":"d21a88a6-d50d-4291-8c0a-83ba536d916d","resolution":{"observed_at":"2026-08-07T05:49:53.310525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-07T05:49:53.313653Z","title":"Towards general text embeddings with multi-stage contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.313653Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:53bf67860fa771545ea0eab02eab19627d3b4fc241ef56aaad0ae21d757b686b","observation_id":"43ef4468-98cc-4c9e-9be2-577564468c64","resolution":{"observed_at":"2026-08-07T05:49:53.313653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.316432Z","title":"Variants of the hungarian method for assignment problems","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.316432Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e40562b9d1ac66b4f25736ea741b8b50a6a8ec8bcbcee3e0c0acf417408bca5f","observation_id":"0cc2a8d5-55cd-4c78-9013-06881199978f","resolution":{"observed_at":"2026-08-07T05:49:53.316432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.319165Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.319165Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:cab62226a1f94551c39befdcf9c55a3cc4225f95595933395d5dc4a52bb539e8","observation_id":"c9527294-ac5e-4fa7-bc35-06407f19f055","resolution":{"observed_at":"2026-08-07T05:49:53.319165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T05:49:53.321734Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.321734Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ff2187359e00eed5900686c45cf9e4679cfbbc24345d7dd98074fd2ef9de1450","observation_id":"75b41b82-8f33-443b-a107-50688a16e005","resolution":{"observed_at":"2026-08-07T05:49:53.321734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.324462Z","title":"High-fidelity audio compression with improved rvqgan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.324462Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:cb8d7a002117fd8c366ca2f356f83c1f3cdb1994ed8d2e9878db1426d18fd6b7","observation_id":"861d624e-75d6-47de-be27-79ed826e7e49","resolution":{"observed_at":"2026-08-07T05:49:53.324462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:49:53.326881Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.326881Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:095f44e889d432554f9ec2afd754a400067a315b36277ea54bbaa5f828474226","observation_id":"4faf8e1e-e314-4294-9137-d87b8caf369f","resolution":{"observed_at":"2026-08-07T05:49:53.326881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T05:49:53.329657Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.329657Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:edea214d49b528ee99126182e878f56d96e1dd42cdd50f6d7521b2bd5ddb76e7","observation_id":"521efbb0-9174-4f8f-9d04-0aca524bec44","resolution":{"observed_at":"2026-08-07T05:49:53.329657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.332855Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.332855Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8c07e9e0a92bf217a3af2a85c800963882f2467a05d6cf2c4700d47b9b5d7b01","observation_id":"64c22047-d71b-4f29-9eed-692710e1357a","resolution":{"observed_at":"2026-08-07T05:49:53.332855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-07-30T11:11:52.165985Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-07T05:49:53.335527Z","title":"Video question answering: Datasets, algorithms and challenges","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.335527Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ff5c310a5c8cc0efa4799cf0468e54944da8af7daad0a2c987cc91bbacc5f37a","observation_id":"1e9f3a76-d7a7-4118-adb0-2a0b0df3377f","resolution":{"observed_at":"2026-08-07T05:49:53.335527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T05:49:53.338244Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.338244Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:2fb3d6c72f8acb404a6bb7a19ab0e39ed1b72745f98954258b7382f432432d36","observation_id":"d005edee-7e59-453d-a80b-70df346af50f","resolution":{"observed_at":"2026-08-07T05:49:53.338244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.341351Z","title":"Movieqa: Understanding stories in movies through question-answering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.341351Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e28de855c559bcddd870a8df8e161588ea4d0b257e2d3a0940333f0a110eb248","observation_id":"44fd02b2-02c6-4094-a565-5d80afc81ff9","resolution":{"observed_at":"2026-08-07T05:49:53.341351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.344344Z","title":"Are we asking the right questions in movieqa? In Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops, pages 0–0, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.344344Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4fbd71e8f8b4e4136538aa40fd4170d5549ee2ec6339416bdc21f2a52fda1a07","observation_id":"1e25c88d-2c88-4a7a-9074-80b411e855b5","resolution":{"observed_at":"2026-08-07T05:49:53.344344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.347140Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.347140Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d0818ccbb401f578fa7156c67b5ef017bffb288c75bcfd0705438a9046905ec9","observation_id":"e13897b5-9982-4b69-b512-dcf1b32f27c5","resolution":{"observed_at":"2026-08-07T05:49:53.347140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-04T13:33:48.224677Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-08-07T05:49:53.349615Z","title":"How2: a large-scale dataset for multimodal language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.349615Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:57666f21ec80f5277c002d67c2363da1641033079a94a99b4750b5a868b32414","observation_id":"04042d7a-4529-42c6-add3-d490954fb018","resolution":{"observed_at":"2026-08-07T05:49:53.349615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.352727Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.352727Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b3be42698104908906609cb3635fc387db03a26bb46f25dec04886fe213d69d2","observation_id":"dd516ceb-d6e4-4528-8a6e-b47a87b04001","resolution":{"observed_at":"2026-08-07T05:49:53.352727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.354968Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.354968Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8d3f60daa5c424f88f3695c1d6d831b8a0db74ee27216bcfd92345f6d227a1f6","observation_id":"4de816fd-bc2a-4bcb-90f1-f11d582fca64","resolution":{"observed_at":"2026-08-07T05:49:53.354968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T05:49:53.357596Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.357596Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5524d75907c8f02e0cd24df9de60117c05d71c1e2e7bc34d3e746cddedf8558b","observation_id":"28fd6f61-85cf-4000-9df3-5bdea4755f80","resolution":{"observed_at":"2026-08-07T05:49:53.357596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.360494Z","title":"Agqa: A benchmark for compositional spatio-temporal reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.360494Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:80726613a140a8326c8d5e7b4c3c58eaf853f696485dc253d8700f53b3019d08","observation_id":"c14e6391-f72e-47a3-9cbe-5663d75b4092","resolution":{"observed_at":"2026-08-07T05:49:53.360494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.363689Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.363689Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:1dce797370d28f480c344e0e4e535fa04beea9b0d1dcfadfc05271c14f6fb308","observation_id":"dfa4da0a-2546-47a2-9d07-f89a2ae3df00","resolution":{"observed_at":"2026-08-07T05:49:53.363689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.366642Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.366642Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:36aa143cc4b30f93c219feb52ec12eeb2636dae02b72d5fa3cd25fc267e81a12","observation_id":"4129b2ae-f882-4af7-9895-bbe0823ac0cb","resolution":{"observed_at":"2026-08-07T05:49:53.366642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.369194Z","title":"Just ask: Learning to answer questions from millions of narrated videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.369194Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:fe486f7d93781d89f9627a832facc991a2572350d95853daeba12fdaac5ccfa8","observation_id":"c8204057-19fa-4593-b216-cc2fbaa405a1","resolution":{"observed_at":"2026-08-07T05:49:53.369194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05040","last_updated":"2025-06-30T07:41:07Z","snapshot_observed_at":"2026-08-07T16:07:58.938906Z","submitted_at":"2025-04-07T13:05:09Z","title":"InstructionBench: An Instructional Video Understanding Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05040","snapshot_observed_at":"2026-08-07T05:49:53.372532Z","title":"Instructionbench: An instructional video understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.372532Z"},"links":{"cited_paper":"/paper/2504.05040","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:f6a5e7965ed74e71c0b5a13295431de1f8c54291ae05621ce3a735d35b196025","observation_id":"b3a54a4b-e9d3-4d54-a0b1-7cbe0b1e541f","resolution":{"observed_at":"2026-08-07T05:49:53.372532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-09T20:29:20.505084Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T05:49:53.375278Z","title":"Hd-epic: A highly-detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.375278Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d48c5b5541b034e8bc7f6e6507883136b75f0cc6265551450fd563dc0b31d213","observation_id":"cb94633a-c344-46d0-a195-ee1cbbcc352c","resolution":{"observed_at":"2026-08-07T05:49:53.375278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.378573Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.378573Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a3047fcc73ab9796a622d6ebd76e53205b4cab3182043ba9faaed8ef90e72c09","observation_id":"7fa9c4d4-f755-44ca-9822-11dfc0246416","resolution":{"observed_at":"2026-08-07T05:49:53.378573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.381710Z","title":"Ego-exo4d: Understand- ing skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.381710Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3c68481c90c295664971d380165f420de8fda7ed9eaaac14b8b4f5da814aed3e","observation_id":"812bdbe8-357f-4318-92ae-ef9fe1546578","resolution":{"observed_at":"2026-08-07T05:49:53.381710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.384201Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.384201Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:cd860864275aade895ccd01aea2c32f8464a8c99d21e68d6796926a0e2862eee","observation_id":"4a9a7a8e-fa8e-465d-a7c3-0011f7212f13","resolution":{"observed_at":"2026-08-07T05:49:53.384201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.387583Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.387583Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0f23b109ac4743c65e8d3946c4205b6719de1d13a749828d89b844b464bcbcf2","observation_id":"5c323aad-84cb-4215-9c20-e0af2b7a6b7e","resolution":{"observed_at":"2026-08-07T05:49:53.387583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:49:53.390941Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.390941Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e9bbb0026edd057e9f3d5b14a43630f080f755970c52399c04b0a56f77566675","observation_id":"f5324068-7c28-4598-a0ac-5e7f23433fe8","resolution":{"observed_at":"2026-08-07T05:49:53.390941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:49:53.393475Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.393475Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:41da280db665326d96ac333733d522fc1aca27a20bdd32f89b05ed61e5a2359c","observation_id":"4714920f-c24b-4c1a-a7e2-0299bb14b562","resolution":{"observed_at":"2026-08-07T05:49:53.393475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T05:49:53.397026Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.397026Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:016d75ba66467cfa1ef2768d2920e8c51a501b97827eb094a19b713d768f4dda","observation_id":"20fd0780-27b5-4a90-872a-f5ccf4089a5d","resolution":{"observed_at":"2026-08-07T05:49:53.397026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:49:53.399967Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.399967Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:646da37240d72b9c008d757b47fedafcc224653dba9fc0e7878eada01887bff8","observation_id":"78fa4c01-ccd7-4fb7-b01c-789b8ccbdd51","resolution":{"observed_at":"2026-08-07T05:49:53.399967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:49:53.403166Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.403166Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:bb8000384c9ba221fad1dfdcd9a373e1116782edc84d1349b77e1b5ad534712c","observation_id":"3e0fbcc7-cc27-4663-a7cd-b84c9c0db2f4","resolution":{"observed_at":"2026-08-07T05:49:53.403166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T05:49:53.405853Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.405853Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4c113edc054c97c88b309c6a921e2ea3f8aec333de0c8c44a2afe9d0dd23e376","observation_id":"01eb85a9-d3e8-4f7e-9a2d-ffdb046686dc","resolution":{"observed_at":"2026-08-07T05:49:53.405853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T05:49:53.408552Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.408552Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b8935b1b76f047d03b655e2b73733ec2c7d1481ec95f494280bc8ce1cc055c0c","observation_id":"372c0c6c-ddb6-46d8-8879-8a2903415c3f","resolution":{"observed_at":"2026-08-07T05:49:53.408552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T05:49:53.411481Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.411481Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:6c402d231b2d9d3247263039ab818f5a5b6f29cb3ec6c14564f66bdff852c6d6","observation_id":"ea34d88d-cd06-4fee-838a-1704492c1e8c","resolution":{"observed_at":"2026-08-07T05:49:53.411481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.414273Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via hybrid architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.414273Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e775e8c0d2801a642304eadc663bda62323abbcf4e35c6fe680c4f616756dbe8","observation_id":"785eeebb-0c74-458b-91e0-3df35fdf5fc7","resolution":{"observed_at":"2026-08-07T05:49:53.414273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T05:49:53.416913Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.416913Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:4e707e70bffe60cfcaf7d009f8788e41dbd73307125af2764916c94433a9d9c8","observation_id":"dc8fecce-635a-4350-823e-a604ad8268a5","resolution":{"observed_at":"2026-08-07T05:49:53.416913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-07T05:49:53.419480Z","title":"Flash- vstream: Memory-based real-time understanding for long video streams.arXiv preprint arXiv:2406.08085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.419480Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:79041f5308a410042f3b47e839fc36993ba9ed2688f4b89f2c155cd66e08542c","observation_id":"5c7ac51c-e03f-4c20-be75-737f1f5e4b4e","resolution":{"observed_at":"2026-08-07T05:49:53.419480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11481","last_updated":"2024-07-15T09:54:30Z","snapshot_observed_at":"2026-08-10T04:48:03.058704Z","submitted_at":"2024-03-18T05:07:59Z","title":"VideoAgent: A Memory-augmented Multimodal Agent for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11481","snapshot_observed_at":"2026-08-07T05:49:53.422447Z","title":"Videoagent: A memory- augmented multimodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.422447Z"},"links":{"cited_paper":"/paper/2403.11481","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:09c8f41c1270cfbe621f5ed698e4a5625ebe1371912201f41dd17eab5c48c488","observation_id":"1eca1a7e-e2ae-4794-9fb8-a2cf4f1428ac","resolution":{"observed_at":"2026-08-07T05:49:53.422447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-08T16:44:49.841179Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-07T05:49:53.425309Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.425309Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:bd3f60b5347c957469ffaf605a3017363d3fcd9ade2b1f4b573148107dd31219","observation_id":"c0c07cc0-f991-4305-80a8-37b2a2c996c5","resolution":{"observed_at":"2026-08-07T05:49:53.425309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T05:49:53.428376Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.428376Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:309d2a9b3e259617817e65bdd71464c213b02bbe92370e4d154558e398ac09ea","observation_id":"28f45b09-2bf9-437a-841d-7b2e7489b3af","resolution":{"observed_at":"2026-08-07T05:49:53.428376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.431459Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.431459Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:76344e6067a5a83909000049bc96c667372fa01ba6dce537cdda21f1c833b40d","observation_id":"307dc06e-81df-428d-b77f-398c091a9c6c","resolution":{"observed_at":"2026-08-07T05:49:53.431459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.434530Z","title":"Active retrieval augmented generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.434530Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ff95fcf8616c4f2cfce552ae1c286e63dbe970ac744c1c4f435babd8c7043388","observation_id":"b84ea8fc-79e5-4af5-89b9-ee20d9c47a53","resolution":{"observed_at":"2026-08-07T05:49:53.434530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.437517Z","title":"Sentence-level prompts benefit composed image retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.437517Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b6a4fd05cbb10a4b06127e6a10554fa87406c219f63ab18fea92922175ce3cdd","observation_id":"8afc8e91-0f1c-47c2-8a98-f9cd1ff1daed","resolution":{"observed_at":"2026-08-07T05:49:53.437517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12273","last_updated":"2023-12-19T15:56:08Z","snapshot_observed_at":"2026-07-06T17:05:22.992895Z","submitted_at":"2023-12-19T15:56:08Z","title":"VQA4CIR: Boosting Composed Image Retrieval with Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12273","snapshot_observed_at":"2026-08-07T05:49:53.440763Z","title":"Vqa4cir: Boosting composed image retrieval with visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.440763Z"},"links":{"cited_paper":"/paper/2312.12273","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:508f9d39588c2fc62b2738c828f5eb207788f2bd13eb97ed1da3e468a9fdd5b7","observation_id":"7e026fbc-b4f4-4fb3-806c-4d987713efd9","resolution":{"observed_at":"2026-08-07T05:49:53.440763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01219","last_updated":"2024-07-01T12:06:34Z","snapshot_observed_at":"2026-08-10T05:00:54.104744Z","submitted_at":"2024-07-01T12:06:34Z","title":"Searching for Best Practices in Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01219","snapshot_observed_at":"2026-08-07T05:49:53.443996Z","title":"Searching for best practices in retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.443996Z"},"links":{"cited_paper":"/paper/2407.01219","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:0821b092dea87d4af696a08b0ccd7a247f393db039e097acaf16ab1ec61dd45a","observation_id":"fd6652c5-5c9d-4bb3-9842-a4c75f95a24c","resolution":{"observed_at":"2026-08-07T05:49:53.443996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13193","last_updated":"2026-05-19T15:04:52Z","snapshot_observed_at":"2026-07-06T18:48:16.629078Z","submitted_at":"2024-07-18T06:06:53Z","title":"Retrieval-Augmented Generation for Natural Language Processing: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13193","snapshot_observed_at":"2026-08-07T05:49:53.447621Z","title":"Retrieval-augmented generation for natural language processing: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.447621Z"},"links":{"cited_paper":"/paper/2407.13193","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:5cdb4426e3e4ac481999b0236a92d7c28a8e3c1f6128f9ea67e9411145a340ee","observation_id":"211330bc-be32-4ab6-8105-170281393d0f","resolution":{"observed_at":"2026-08-07T05:49:53.447621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10981","last_updated":"2024-08-23T00:17:02Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T01:27:42Z","title":"A Survey on Retrieval-Augmented Text Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10981","snapshot_observed_at":"2026-08-07T05:49:53.450836Z","title":"A survey on retrieval-augmented text generation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.450836Z"},"links":{"cited_paper":"/paper/2404.10981","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:ab0a222af8d424cf9dd96fb9da2db46bfe33581bf23f53b413bdc437a52f4141","observation_id":"3de5b9a1-3313-48b8-a56f-8d2929889cf1","resolution":{"observed_at":"2026-08-07T05:49:53.450836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19473","last_updated":"2024-06-21T08:26:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:59:01Z","title":"Retrieval-Augmented Generation for AI-Generated Content: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19473","snapshot_observed_at":"2026-08-07T05:49:53.453946Z","title":"Retrieval-augmented generation for ai-generated content: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.453946Z"},"links":{"cited_paper":"/paper/2402.19473","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:f25a958b141c7266b0da71805a56143ba36562a960d6cf061984697fc5a8c887","observation_id":"cea28d7a-102d-4cb3-856a-122697f58eb1","resolution":{"observed_at":"2026-08-07T05:49:53.453946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11511","snapshot_observed_at":"2026-08-07T05:49:53.457193Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.457193Z"},"links":{"cited_paper":"/paper/2310.11511","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8fa259ea764335720574d29e95ba03dba564613d78a827843070f49edc89ab73","observation_id":"bf8931c0-9ddf-442f-9271-4b1c7f1279ff","resolution":{"observed_at":"2026-08-07T05:49:53.457193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.460122Z","title":"Realm: Retrieval- augmented language model pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.460122Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:9f3c74b8394aabb601186e43b00f094e8e844a0ca3883a8b4b0ebab5b8f03ae7","observation_id":"82e24110-d08c-4dbe-9695-4b2b63acb26f","resolution":{"observed_at":"2026-08-07T05:49:53.460122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15225","last_updated":"2023-06-25T17:56:37Z","snapshot_observed_at":"2026-07-06T15:32:35.999476Z","submitted_at":"2023-05-24T15:07:30Z","title":"SAIL: Search-Augmented Instruction Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15225","snapshot_observed_at":"2026-08-07T05:49:53.463160Z","title":"SAIL: Search-augmented instruction learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.463160Z"},"links":{"cited_paper":"/paper/2305.15225","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e2f9685c3fc2eac17454983cd4ec9cd91f92f0acb0b9b5400def1492bbba4467","observation_id":"a1e3442f-a6d3-46a9-8103-6820d27ca7e6","resolution":{"observed_at":"2026-08-07T05:49:53.463160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.465906Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.465906Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:8d650c47c1344abcb8119dcbc3db28e034b4a6ec33d8e828015015b271a438ca","observation_id":"f6995908-3bb9-49a2-8ee2-fe0fc8b4e038","resolution":{"observed_at":"2026-08-07T05:49:53.465906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.469041Z","title":"Document haystacks: Vision-language reasoning over piles of 1000+ documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.469041Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:f84a67f2b2a940603cc167d8918197a9766f8e8d44f39fcb8daa40dfcc299ec4","observation_id":"9d1c0ee8-f18d-4add-88fc-4f40f10f5aea","resolution":{"observed_at":"2026-08-07T05:49:53.469041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.472251Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.472251Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e8b02c8e489874f32a10126736901dfa51b07047b3cdee262fcc983d42364350","observation_id":"ecef7520-2cff-45d5-9b6d-d3d4fb5e731a","resolution":{"observed_at":"2026-08-07T05:49:53.472251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13766","last_updated":"2025-03-11T17:31:27Z","snapshot_observed_at":"2026-08-03T10:33:33.362949Z","submitted_at":"2024-07-18T17:59:30Z","title":"Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13766","snapshot_observed_at":"2026-08-07T05:49:53.475228Z","title":"Gonzalez, Trevor Darrell, and David M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.475228Z"},"links":{"cited_paper":"/paper/2407.13766","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a9264a3db6592d072aebb903e79215a772ef1283b81a8b23c953e65df7e4106d","observation_id":"03f03589-0a7e-44de-a1b4-023e511b63e0","resolution":{"observed_at":"2026-08-07T05:49:53.475228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-10T05:52:50.722724Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-07T05:49:53.478155Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.478155Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:3ecf79348adb1e6f3b71189f044fcb6b28f97b5522d1902c28ae2ca18d8997c4","observation_id":"b601c34f-c801-408f-b65c-b77ebb3da369","resolution":{"observed_at":"2026-08-07T05:49:53.478155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16636","last_updated":"2025-08-15T09:45:15Z","snapshot_observed_at":"2026-08-07T17:55:00.749664Z","submitted_at":"2025-02-23T16:23:50Z","title":"Visual-RAG: Benchmarking Text-to-Image Retrieval Augmented Generation for Visual Knowledge Intensive Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16636","snapshot_observed_at":"2026-08-07T05:49:53.481450Z","title":"Visual-rag: Benchmarking text-to-image retrieval augmented generation for visual knowledge intensive queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.481450Z"},"links":{"cited_paper":"/paper/2502.16636","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:075ae5890297a5e9a9d85226b786dec450758fe6b742935f9a22ed6a7c2d80d5","observation_id":"326e72fd-02cb-4c9e-924a-f48db5577fca","resolution":{"observed_at":"2026-08-07T05:49:53.481450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.484538Z","title":"Vdocrag: Retrieval-augmented generation over visually-rich documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.484538Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:05790d850e5f2a56b8e9b9956ef9c3922199a28429bb6a1d72ad7ca6e22aec17","observation_id":"ffd5fd2a-22ec-48b0-bdf5-303b0fafa39b","resolution":{"observed_at":"2026-08-07T05:49:53.484538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03809","last_updated":"2022-10-29T10:08:13Z","snapshot_observed_at":"2026-08-05T15:50:39.183704Z","submitted_at":"2022-10-07T20:35:58Z","title":"Retrieval Augmented Visual Question Answering with Outside Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03809","snapshot_observed_at":"2026-08-07T05:49:53.487275Z","title":"Retrieval augmented visual question answering with outside knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.487275Z"},"links":{"cited_paper":"/paper/2210.03809","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c1ca1c8e9db79aa7c62d33d792a467593c040c55351f4554cb884b0d8edef468","observation_id":"cc435739-a5a2-4dbf-bfbf-127ac913f76d","resolution":{"observed_at":"2026-08-07T05:49:53.487275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15268","last_updated":"2025-02-06T05:51:07Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T21:04:28Z","title":"Fact-Aware Multimodal Retrieval Augmentation for Accurate Medical Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15268","snapshot_observed_at":"2026-08-07T05:49:53.490369Z","title":"Fact-aware multimodal retrieval augmentation for accurate medical radiology report generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.490369Z"},"links":{"cited_paper":"/paper/2407.15268","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:743c546bc2bf3dfb004fe566ee455a7693e3f891e1854914c284f3f143311311","observation_id":"13bf5ae5-ae74-47dc-b20a-7252476bba83","resolution":{"observed_at":"2026-08-07T05:49:53.490369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.493573Z","title":"Rule: Reliable multimodal rag for factuality in medical vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.493573Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d20e4b848e2945cb0b3fc618addd67761feeddc3b8d1c0a4874899ff69c40af5","observation_id":"3a3c1727-6ef2-48e4-88fb-1affe423f913","resolution":{"observed_at":"2026-08-07T05:49:53.493573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:49:53.496853Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.496853Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:46d10a7740e55cea654f190c2b0a4d855d3b83d5994ed8cacb9f659b4db0aa3a","observation_id":"fe7e62fc-4e71-4d67-8fa1-ece2db426d5e","resolution":{"observed_at":"2026-08-07T05:49:53.496853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.499783Z","title":"Gpt-4o: Enhanced multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.499783Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:df87cfa7c8f838166afd81a1d539ce1f602e8a230eae21b5cbe88f1236e26f2c","observation_id":"27713dc0-bfae-43f4-8ab4-52514fc9136e","resolution":{"observed_at":"2026-08-07T05:49:53.499783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.502745Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.502745Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a82ec5c23182b539c6e2e01a626cecb8ba735987224815a03d24ac5524cdd763","observation_id":"740f4cb2-fa07-4a92-9683-d5d6d5972ec0","resolution":{"observed_at":"2026-08-07T05:49:53.502745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-07-06T13:22:09.403770Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-08-07T05:49:53.505625Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.505625Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:a15fe782a7f63a158a587b747e6a40c34a74d83f1748f18bf01135ab7d6964b6","observation_id":"8129eeaa-5041-402e-90f5-2c55f99f7835","resolution":{"observed_at":"2026-08-07T05:49:53.505625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-07T05:49:53.509123Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.509123Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:091a9b471dc47ddb3bceea424907db6cdf634de5da9746cb3393aabfb5674980","observation_id":"e9e009aa-e610-432d-a75e-7b9b36171587","resolution":{"observed_at":"2026-08-07T05:49:53.509123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.511845Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.511845Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:2431ed3bf904ca128a7dc262379f3e7394bae8e1cccc2fc24e722b929f507678","observation_id":"f397db9d-cebe-4215-ac62-ec113453365f","resolution":{"observed_at":"2026-08-07T05:49:53.511845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T05:49:53.514613Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.514613Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:999079b57db93acffffdeb0a51fc3ce6e2f051e275373b40e89b2e6208195b98","observation_id":"fd642cb6-bd08-4575-a76d-a41451365bf0","resolution":{"observed_at":"2026-08-07T05:49:53.514613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T05:49:53.517861Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.517861Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:e6bebf305eb8172d4904e067e437d82c8038a89416812d083f449e44bdab9de2","observation_id":"10e2c647-8096-410e-bede-17e3d463131c","resolution":{"observed_at":"2026-08-07T05:49:53.517861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-09T16:01:36.816495Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01549","snapshot_observed_at":"2026-08-07T05:49:53.521074Z","title":"Videorag: Retrieval- augmented generation with extreme long-context videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.521074Z"},"links":{"cited_paper":"/paper/2502.01549","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:28551e70a08ecc2c5490aa23fe4b8d5e91793551bce226c5e894db1786a6e5f9","observation_id":"8712754c-c291-4b51-9ca2-36203477e74a","resolution":{"observed_at":"2026-08-07T05:49:53.521074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.523879Z","title":"V-desirr: Very fast deep embedded single image reflection removal","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.523879Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:04378b3a0af4c64d0a41be58e550e0f9f70b0044070c1ee4f84c22e0b2f16a89","observation_id":"94a4611f-a6a2-4342-a19f-f5cbfc809bc6","resolution":{"observed_at":"2026-08-07T05:49:53.523879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.526839Z","title":"Measured albedo in the wild: Filling the gap in intrinsics evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.526839Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:d394062c0ee90b96cc5c824e85525279a9e02a88cdb5ddf36fa8a660f9275f8c","observation_id":"cb64ee82-bb51-4f1b-a730-c2ccfc1ca690","resolution":{"observed_at":"2026-08-07T05:49:53.526839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.530209Z","title":"Adverb: Visually guided audio dereverberation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.530209Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:13aeac4040b04df1d5f1b75ea658893dab7f93d00479c70d8d72830185fbca5a","observation_id":"ccf0e7a5-89b1-422e-b981-79f3699f5364","resolution":{"observed_at":"2026-08-07T05:49:53.530209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.533720Z","title":"Melfusion: Synthesizing music from image and language cues using diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.533720Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:48401a5a7b093f5cdcd2b9b7ca8d7ec3e2d56ad13cb3b1eb5ca26491e5ae04fd","observation_id":"24a613e3-e1f0-43fe-89fb-6bf65e1a63a2","resolution":{"observed_at":"2026-08-07T05:49:53.533720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.536648Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.536648Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:34b6274f2cd488050249ee10fc3ad2c6e8a8c3fa35fb7f4fc1b1d37417ba8b92","observation_id":"ece97e52-8192-434d-8c9a-7279ccfaf2c2","resolution":{"observed_at":"2026-08-07T05:49:53.536648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:53.539318Z","title":"Codi-2: In-context interleaved and interactive any-to-any generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.539318Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:9798794c1ed31d786b60d426cd83860267d7a320b8b9178ca682df178aa89648","observation_id":"e61e0399-ea2b-4839-8675-591d47f90ef7","resolution":{"observed_at":"2026-08-07T05:49:53.539318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:54.390385Z","title":"Listen to the pixels","venue":null,"work_id":"60a6f391-2407-4a32-9204-2a6546cb5cca","year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.542548Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:fa7fc9e5dbca5d917decf91616eb1211c3452a316fa1f900ebdcccba011b4943","observation_id":"95e292b2-e55e-489f-8221-178eeb0a9785","resolution":{"observed_at":"2026-08-07T05:49:54.393061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:54.381661Z","title":"Audvisum: Self- supervised deep reinforcement learning for diverse audio-visual summary generation","venue":null,"work_id":"1cbb63c1-fe7e-49e7-9d5c-47a50537e962","year":2021},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.545730Z"},"links":{"citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:c70ccd2e79b8560c9e2e83f621f74bbbcd19ec1d0d595b5d5c7de4ecbb3477cd","observation_id":"8df9726a-60c8-4102-83a5-372640adcbd6","resolution":{"observed_at":"2026-08-07T05:49:54.385050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":127},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 127 outbound references and 3 inbound Pith citation observations for arXiv:2506.07016."}