{"as_of":"2026-08-10T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c36552c48b1eeb6af797c1fc1ecc5e8c73e4b489e9f79bcde9e4cacd75ac492","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:41:39.062407Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04976/citation-record","integrity":"/paper/2507.04976/integrity","json":"/paper/2507.04976/citation-record.json","paper":"/paper/2507.04976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.387203Z","title":"Figure 14:Prompt used for Evaluation:(a) Evaluation prompt for answerable dataset, and (b) Evaluation prompt for our unanswerable dataset","venue":null,"work_id":"9e3783ea-b07b-485b-9649-7fd49f09f969","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.870093Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:9d20c2acc5f3de9540ef4a8625139cc470f6d9b6ac7b53c5cf3355a8f8eb9c26","observation_id":"8dc3bbba-9988-4504-9af2-da643588d748","resolution":{"observed_at":"2026-08-06T19:41:40.468104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:41.285613Z","title":null,"venue":null,"work_id":"4bd26a1a-ea9d-4071-9802-3e762225791e","year":1901},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.065756Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:42aa507eb5aa7cd770ce27516d11c97e69db4eb080b4d72c4021b0a80c225e8f","observation_id":"02f5da86-7927-41f2-a283-6efff1c09946","resolution":{"observed_at":"2026-08-06T19:41:41.346617Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.644726Z","title":"A.3 ETHICSSTATEMENT In our study, we utilize Large Language Models (LLM) to generate our UVQA dataset and evaluate video-LLMs, which may result in unintended outcomes","venue":null,"work_id":"817eb98c-fbb6-4e4a-8ff3-d89fc26d8d4b","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.744180Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:1e477c30dd47d1a0424ad82f60721291adb898178195f21f08623935e2b435d8","observation_id":"57943758-8e5e-41ea-94d9-3e882fba7ed4","resolution":{"observed_at":"2026-08-06T19:41:40.705794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:41:37.255667Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.255667Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:56133a24b4e41eaf99cb2dade872af131be9b220f4829a1346d976ded3d8a205","observation_id":"85137c54-8704-444c-bb7d-3a88e310606d","resolution":{"observed_at":"2026-08-06T19:41:37.255667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10942","last_updated":"2024-08-21T06:13:53Z","snapshot_observed_at":"2026-07-31T03:23:07.789560Z","submitted_at":"2023-10-17T02:38:09Z","title":"UNK-VQA: A Dataset and a Probe into the Abstention Ability of Multi-modal Large Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10942","snapshot_observed_at":"2026-08-06T19:41:37.335716Z","title":"Unanswerable visual question answering.arXiv preprint arXiv:2310.10942,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.335716Z"},"links":{"cited_paper":"/paper/2310.10942","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:beb5713755cf4c1593b3479a9788d824f6205cfffec5d2fb0967b1a5d60b4f28","observation_id":"73f65394-be23-4b3f-a8e5-b7a101e5b96d","resolution":{"observed_at":"2026-08-06T19:41:37.335716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:41.161358Z","title":"URL https://aclanthology","venue":null,"work_id":"cb33b099-7afd-41d9-8255-902945659ef2","year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.912431Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:0c5fde0892059867886ce7f2e7113f5e0e057930a182ddd6737cda4a64e6896b","observation_id":"62189781-c344-4e24-b858-45b5902f6ba8","resolution":{"observed_at":"2026-08-06T19:41:41.204900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02655","last_updated":"2022-05-30T19:45:05Z","snapshot_observed_at":"2026-08-06T04:48:55.317633Z","submitted_at":"2022-05-05T13:56:18Z","title":"Language Models Can See: Plugging Visual Controls in Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02655","snapshot_observed_at":"2026-08-06T19:41:38.021957Z","title":"Language models can see: Plugging visual controls in text generation.arXiv preprint arXiv:2205.02655,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.021957Z"},"links":{"cited_paper":"/paper/2205.02655","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:1d53b3b512170f89d73075f8ea7dd98f341d4078c08d72c9f00d0be143345d57","observation_id":"00f23829-0ca4-4a92-8137-c43ac7228a64","resolution":{"observed_at":"2026-08-06T19:41:38.021957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T19:41:38.043123Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.043123Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:77a7d3ad723f8a2ea79812c9bd569e7c7f2c7331de731f278ad64edb22e1b7cc","observation_id":"9118d1cc-2d16-46f2-b112-37ed7af3a42a","resolution":{"observed_at":"2026-08-06T19:41:38.043123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:41:38.101205Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.101205Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:f1b81efadadbd6e2b8d371d0a86300a1f306eb34a92841e6bf06dc62747334e6","observation_id":"0347a6c8-223a-4acd-985c-78e758eeced3","resolution":{"observed_at":"2026-08-06T19:41:38.101205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18418","last_updated":"2025-02-12T05:42:09Z","snapshot_observed_at":"2026-07-06T18:52:07.765911Z","submitted_at":"2024-07-25T22:31:50Z","title":"Know Your Limits: A Survey of Abstention in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18418","snapshot_observed_at":"2026-08-06T19:41:38.196093Z","title":"Know your limits: A survey of abstention in large language models.arXiv preprint arXiv:2407.18418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.196093Z"},"links":{"cited_paper":"/paper/2407.18418","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:29efc928224413ad7ba9d4c621d26b387b718750d0f341bb142e39552ea990fa","observation_id":"0683f6b1-37ae-4a44-a710-5083f293a2a1","resolution":{"observed_at":"2026-08-06T19:41:38.196093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:41.026681Z","title":"Reliable visual question answering: Abstain rather than answer incorrectly","venue":null,"work_id":"54adc77a-a822-4be7-a424-3b22602ab882","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.247478Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:c7171b94aef72548371bf545131ba239fde07dd4a6171a312768be44123f5812","observation_id":"8881582b-3d4b-45c7-9a09-7e66de6adf72","resolution":{"observed_at":"2026-08-06T19:41:41.101947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:38.377164Z","title":"TLCR: Token-level continuous reward for fine-grained reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.377164Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:086f88e08b42d55b5358a0106a712bc48c4214a9c690eb12ccf0ddccd4ff8641","observation_id":"94a70e9d-42ba-4c91-8346-677d493d6595","resolution":{"observed_at":"2026-08-06T19:41:38.377164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.280","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.131429Z","title":"doi: 10.18653/v1/2022.emnlp-main.280","venue":null,"work_id":"d2da3256-1866-431b-8c1c-1db442e1fc54","year":2022},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.442554Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:27fc9458ce6bc66bbc145b388b1d073a9585578cbd2560e5e66ba538cff04c61","observation_id":"161abb5c-963a-480d-9f2d-f8cc0305dab7","resolution":{"observed_at":"2026-08-06T19:41:39.212989Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:38.481770Z","title":"doi: 10.18653/v1/2023.findings-emnlp.797","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.481770Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:35cf6fb541ae6f26ddd8cf5b5ee7716ff056f32b8ca0b543cf11f4e8de41cf40","observation_id":"6eb2d644-0901-4600-9cfb-d1dd8dfff21a","resolution":{"observed_at":"2026-08-06T19:41:38.481770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T19:41:38.650060Z","title":"doi: 10.18653/ v1/2023.emnlp-demo.49","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.650060Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:8633ce896bd0abe0f73233d2d20ed6482a1ed232777143beafae9d657a8e74cb","observation_id":"80aecfca-840e-43ab-83a4-dc31abeba65e","resolution":{"observed_at":"2026-08-06T19:41:38.650060Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.776578Z","title":null,"venue":null,"work_id":"a97ddffc-4fed-4bb9-b0e3-36a81c79b806","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.693004Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:2949c3103d90468c8c151d77ea6a3dbd96566532d731c155e7e07d5d2395fd3a","observation_id":"f6e78513-1439-4059-a12c-58f917db02c8","resolution":{"observed_at":"2026-08-06T19:41:40.862940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.515483Z","title":"(2023); Li et al","venue":null,"work_id":"e9ee751e-e011-4971-a247-7fda6722aa60","year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.838760Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:6bdca42315b34ce2efbd742212dba62d3e35b1b73561b33a10c24202c80c3bbd","observation_id":"c83c0aad-ef3c-41b9-846e-4d605e0a9699","resolution":{"observed_at":"2026-08-06T19:41:40.579369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.214347Z","title":null,"venue":null,"work_id":"04461eed-fbb1-4d5f-ba80-9ec3f1f651bb","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.914823Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:10d98b9e75bf04d318f2aa5a2b1a8bba74d1e4e847ee786126fb7b9553e67467","observation_id":"062e422e-1d8d-48b5-9331-3c8c8a40b6d8","resolution":{"observed_at":"2026-08-06T19:41:40.309993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.991664Z","title":"If the question cannot be answered using the video content, state that it is unanswerable and provide a reason","venue":null,"work_id":"6bf7d1a5-2f09-43b8-90e4-22bc29b1672c","year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:39.013143Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:c03bcaf849b6afabf54a535fc3a95b180696a794c7e7999639aab0f9a0fbe390","observation_id":"2b3a4891-e017-4a31-ac0b-74358f2b3dec","resolution":{"observed_at":"2026-08-06T19:41:40.088734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.863815Z","title":"5All annotators have TOEFL iBT scores above 100 and hold at least a bachelor’s degree","venue":null,"work_id":"86ec6bb6-1a22-4a6f-bee9-868caec33d08","year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:39.062407Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:29d4a1acaa5c7777e1c054fe900db458cbc9c907ece98aa81275f21f0a09587f","observation_id":"d5262a23-4d2f-48bc-a386-d802029116e7","resolution":{"observed_at":"2026-08-06T19:41:39.948586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2008.91917","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:39.544307Z","title":"Justin Johnson, Ranjay Krishna, Michael Stark, Li-Jia Li, David A","venue":null,"work_id":"4e2d825c-306b-42db-818f-db9571835faf","year":2008},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.587634Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:076f69843b6a063de7268bcd2d61077e3ca91236b20a76144c2cc70cd14d22ad","observation_id":"df799896-7081-41b3-a7e3-1a1f51c2dac9","resolution":{"observed_at":"2026-08-06T19:41:39.608405Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:37.666437Z","title":"Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, and Lidong Bing","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.666437Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:27099ba9d25d4c809531f4bfe8a79f811e75acdcb9430f2fad580486382c384a","observation_id":"6d3a0d12-eb22-46e0-990d-cc9176b83382","resolution":{"observed_at":"2026-08-06T19:41:37.666437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07000","last_updated":"2024-10-28T05:15:30Z","snapshot_observed_at":"2026-08-04T20:05:49.279957Z","submitted_at":"2023-12-12T06:10:42Z","title":"Alignment for Honesty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07000","snapshot_observed_at":"2026-08-06T19:41:38.287739Z","title":"Alignment for honesty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.287739Z"},"links":{"cited_paper":"/paper/2312.07000","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:caf5830bb02549de453e3e4c56dbf4c4599f75502c7d2753ae8d29a003d7af4a","observation_id":"75009a38-1cf7-40b2-9eeb-61476426c4a0","resolution":{"observed_at":"2026-08-06T19:41:38.287739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05451","last_updated":"2018-11-01T21:48:19Z","snapshot_observed_at":"2026-07-06T06:23:35.306815Z","submitted_at":"2018-02-15T09:50:15Z","title":"Mapping Images to Scene Graphs with Permutation-Invariant Structured Prediction","version":4},"cited_work":{"arxiv_id":"1802.05451","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.05451","snapshot_observed_at":"2026-08-06T19:41:39.704960Z","title":"Mapping Images to Scene Graphs with Permutation-Invariant Structured Prediction","venue":"stat.ML","work_id":"0d9131da-c0c6-4678-813a-05fe77dfcf20","year":2018},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.410814Z"},"links":{"cited_paper":"/paper/1802.05451","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:dc2439c78623142622849f0d6564e748398a151b757919e838dd670236f1ad8d","observation_id":"29e42f01-c0a9-4a27-b57b-40a538265d7d","resolution":{"observed_at":"2026-08-06T19:41:39.743993Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:40.889554Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"8bc4385a-24e3-4dac-911a-7aca80473d66","year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:38.533379Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:083e069f62ddc6c35089db255271c8b487ab5f77a23bfef72d3cfd9534705785","observation_id":"e4ea3966-e96b-4e0e-93ab-c2b5f76afa5a","resolution":{"observed_at":"2026-08-06T19:41:40.964592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T19:41:37.146585Z","title":"Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.146585Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:6353d534f01d58e7c7aed3f0de809a91a648a0906cefef7c6aa9bbb40f25aafc","observation_id":"6d9a7dca-3d00-45b4-b331-d8a61213e178","resolution":{"observed_at":"2026-08-06T19:41:37.146585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T19:41:37.813687Z","title":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.813687Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:2789ead71f05d94c571e678589060bf334b05eca5dacb6ab4a7c26edeaee05d3","observation_id":"0087c442-8ec5-4d59-879e-a0b2f32f4ba8","resolution":{"observed_at":"2026-08-06T19:41:37.813687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:41:37.497820Z","title":"doi: 10.18653/v1/2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.497820Z"},"links":{"citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:b793b3e367158b5398a879dc8cbe6e386a43d7c3d0bbdcb2e5e48d8fcd2f1d50","observation_id":"08062c73-ad7b-42cc-8184-5b9fbc832a40","resolution":{"observed_at":"2026-08-06T19:41:37.497820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-06T19:41:37.015458Z","title":"URL https: //aclanthology.org/2024.acl-long.52","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:37.015458Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2507.04976"},"observation_digest":"sha256:e51f46458cfdcdbcf3765e3f838ee52d4b3dcb952a053f3935395bd23f2b851d","observation_id":"9242563d-580b-4c2c-9616-b4cf89155b5e","resolution":{"observed_at":"2026-08-06T19:41:37.015458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04976","last_updated":"2025-07-07T13:19:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T16:10:22.143371Z","submitted_at":"2025-07-07T13:19:43Z","title":"Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.04976."}