{"as_of":"2026-08-10T07:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c866eba52275ec3f5f33b0cf307ca1a3e1981d27e495b69138403edc36687bb","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:19:20.572832Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13820/citation-record","integrity":"/paper/2507.13820/integrity","json":"/paper/2507.13820/citation-record.json","paper":"/paper/2507.13820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:19.594085Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.594085Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:10a436758b997de03fd2e44e6dd7c7f6f59f1ce385d75c068ddbae5798556392","observation_id":"7942b469-8135-4613-b723-615543de5f56","resolution":{"observed_at":"2026-08-06T16:19:19.594085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:21.018342Z","title":"Gemini 2.5 Pro Preview (2025-03-25) , 2025","venue":null,"work_id":"00938c48-5087-42da-ae6e-a803b300d360","year":2025},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.680262Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:2e98876d59bdc3e4b780d56e5f74b99fde0998004b7c139d04367dfefd7da0a2","observation_id":"a26eab60-698e-4f3f-a062-4c57e6fe0641","resolution":{"observed_at":"2026-08-06T16:19:21.159092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03690","last_updated":"2024-05-08T19:46:35Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:59:45Z","title":"How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03690","snapshot_observed_at":"2026-08-06T16:19:19.770396Z","title":"How good is my video lmm? complex video reasoning and robustness evaluation suite for video-lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.770396Z"},"links":{"cited_paper":"/paper/2405.03690","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:1df81ba07a306b74dfac677387c7aee272d533b706806028a1592513d4a66752","observation_id":"51d3faf4-ad0f-42bd-afbe-a5773eadb2e6","resolution":{"observed_at":"2026-08-06T16:19:19.770396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:20.768800Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"f8def62b-b2c3-475b-91ad-491025511803","year":2024},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:19.916856Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:b659380b6d2e03a421a424bf5d8cd39c3f052a8b478cfc298c980a500bdb944a","observation_id":"fb465385-0d6d-433f-ad89-d4a14ff65ae1","resolution":{"observed_at":"2026-08-06T16:19:20.890382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T16:19:20.053425Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.053425Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:dc25bfe456175e457539df20e27c969f1245ce4d7808fd800a405f30928ac0a1","observation_id":"c4b533c1-c4c3-466b-99f3-ac902afaac00","resolution":{"observed_at":"2026-08-06T16:19:20.053425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T16:19:20.204460Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.204460Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:1b34f274e22b62dafe5ae824188ba1f6248dfc0a8daf921cc13be0f82cebc7d2","observation_id":"7c45b3d7-ddaa-431b-adf1-0af8a14fca00","resolution":{"observed_at":"2026-08-06T16:19:20.204460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T16:19:20.329167Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.329167Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:6d073c7b016e88294dd5118c3aeba65bec97ac6ae804a7cf8ec38f92d2bc9484","observation_id":"3f310098-559d-497b-aa17-2aa12af0fde3","resolution":{"observed_at":"2026-08-06T16:19:20.329167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:19:20.430057Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.430057Z"},"links":{"citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:79a91710fb8bd0a6bb4423552b46376706129953f68d5f58956e3f3de498d781","observation_id":"df85bc52-675d-40b2-9061-7dfa2486f749","resolution":{"observed_at":"2026-08-06T16:19:20.430057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T16:19:20.572832Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:19:20.572832Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.13820"},"observation_digest":"sha256:c3ee7a2e8e4e37eeed14545dfb48f20f432df22bb3a90779ee950586979e1d52","observation_id":"1b7c2315-9f7b-48f5-9ee5-19ff8e9f5dee","resolution":{"observed_at":"2026-08-06T16:19:20.572832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13820","last_updated":"2025-07-18T11:12:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:17:41.658574Z","submitted_at":"2025-07-18T11:12:44Z","title":"Team of One: Cracking Complex Video QA with Model Synergy"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 0 inbound Pith citation observations for arXiv:2507.13820."}