{"as_of":"2026-08-19T04:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ec77d19dbd799e702f6481f0fdd8f44b2818a7fcc18bd1e2cd5eea1066f1e46","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:22:29.090022Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.08771/citation-record","integrity":"/paper/2501.08771/integrity","json":"/paper/2501.08771/citation-record.json","paper":"/paper/2501.08771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.080200Z","title":"Bilinear attention networks,","venue":null,"work_id":"c76b166d-d86a-42d6-8da3-ac1ff30e6010","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.815676Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:824a7a86bfdd9f13a5ee0680035b9dbbc5bfd4590cd51b8e87c0c44ac3332239","observation_id":"9532b078-bd9d-472e-8895-c0dcacd07458","resolution":{"observed_at":"2026-08-10T20:22:30.083794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.068755Z","title":"Attend what you need: Motion-appearance synergistic networks for video question answering,","venue":null,"work_id":"b9bd4074-f6ce-4653-bed2-d87df30f4d66","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.820087Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3cd872f3003f44fafbc6c3a4d8ee2b0a5f5e1011edf42db2cb2da506344681cd","observation_id":"78a8b23e-b5f6-4ecc-8f34-c9b7493bd253","resolution":{"observed_at":"2026-08-10T20:22:30.072790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.058488Z","title":"Video as conditional graph hierarchy for multi-granular question answering","venue":null,"work_id":"7306a99f-f0fb-463e-9f00-4b417e03023e","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.824049Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:748fdc6d828fc7f187acf23f92834952efbc801179047421ffc343a385b99447","observation_id":"58cab2bd-070b-4bfe-807c-6733d6ab7df8","resolution":{"observed_at":"2026-08-10T20:22:30.061788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.048570Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":"561a61c4-af34-4ea3-9c2f-ec8a47482a56","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.828251Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f76002d7f3713c5e8a70c3de861e03f82eb8837eb24bdc9a31c2cfb9e45cc45c","observation_id":"852a8b05-c6fc-4fb9-8212-9d3c23425d1b","resolution":{"observed_at":"2026-08-10T20:22:30.052125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-16T17:39:33.161354Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-08-10T20:22:28.832209Z","title":"Violet: End-to-end video-language transformers with masked visual- token modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.832209Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:911d85ba0a6dee4689b5c04e841b61660cd372c8f3d744f6bff2540532111757","observation_id":"21caaec5-68af-4a53-bed9-af6c1a4b862a","resolution":{"observed_at":"2026-08-10T20:22:28.832209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12402","last_updated":"2023-07-30T13:20:13Z","snapshot_observed_at":"2026-08-16T16:14:08.080032Z","submitted_at":"2022-11-22T16:48:01Z","title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12402","snapshot_observed_at":"2026-08-10T20:22:28.836606Z","title":"X 2-vlm: All-in-one pre-trained model for vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.836606Z"},"links":{"cited_paper":"/paper/2211.12402","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:8e859367a1d90106136318535e9df59efb14a13c6645daf8c5f6639b073b9327","observation_id":"803b90c5-5350-4593-ad3e-b099f4f80ad1","resolution":{"observed_at":"2026-08-10T20:22:28.836606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T20:22:28.840944Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.840944Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f8baff1b6742c9648a411c0701c0f6e21e4c04bf536a5d4098ae2631d31bed4c","observation_id":"a1bf4bc0-51da-4e06-92df-b148982abc98","resolution":{"observed_at":"2026-08-10T20:22:28.840944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.037603Z","title":"All in one: Exploring unified video-language pre-training,","venue":null,"work_id":"8d11ecd7-4045-4c9e-be4f-1e3bb87ab865","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.845487Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:4fb8ca5c79b3df2de6170378f1e1c4b821fd0894fbde77b636fbaa93e3960460","observation_id":"9b75616c-ba59-4a81-b431-8e48192bd12a","resolution":{"observed_at":"2026-08-10T20:22:30.041510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.024865Z","title":"Invariant grounding for video question answering,","venue":null,"work_id":"cd5b89d3-ef2e-4e6a-9a23-ea2872149b9b","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.849971Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:03a7f18c3814f38e1f4c02eb6099f7f083890fd4eafd3b2d4744f5c83bf28675","observation_id":"1eb77c64-db60-464f-bb67-2227cdef559f","resolution":{"observed_at":"2026-08-10T20:22:30.029231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:30.010622Z","title":"Equivariant and invariant grounding for video question answering,","venue":null,"work_id":"55a34a44-d226-4746-bc2c-69d9b1c6b805","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.853927Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7968c7cfeac9efda56fe8c2c574acd3a4dfec4ca5a68501ee43b7c19fa8e9484","observation_id":"bd64f643-ca09-41ba-a6c7-a19c30af739e","resolution":{"observed_at":"2026-08-10T20:22:30.016176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.996251Z","title":"Transformer-empowered invariant grounding for video question answering,","venue":null,"work_id":"72d276d9-72fa-4ec2-9e1d-467751b93203","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.858221Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:8fdf8e9e5b2a27bb8588cd12fd34645ee5a0fa866093233e5530494a4e821893","observation_id":"31bda1b2-d1e2-41f1-8610-04c2a0ef86fb","resolution":{"observed_at":"2026-08-10T20:22:30.000451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.984380Z","title":"Discovering spatio- temporal rationales for video question answering,","venue":null,"work_id":"fadda146-d962-42a0-81c9-792acddcc9fb","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.862463Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:8bee707bf55387e355b435d91aef13c336a1edab1b5413d559d6bdb39d8474bf","observation_id":"dcbdd53f-f305-4ab8-926c-31a3dd24f80a","resolution":{"observed_at":"2026-08-10T20:22:29.988421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.972650Z","title":"Adversarial vqa: A new benchmark for evaluating the robustness of vqa models,","venue":null,"work_id":"f45e7b8c-c3bb-4178-a192-fdf3ed1b82df","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.866406Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e244b56482ed16c5c1bc94222c45d89311b239c2e4f77a51930f7cfc4654f245","observation_id":"4819a8d9-4faa-4d3d-9909-24a637d781d7","resolution":{"observed_at":"2026-08-10T20:22:29.976532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.960215Z","title":"Discovering the real association: Multimodal causal reasoning in video question answering,","venue":null,"work_id":"57c16781-ab90-4635-b4b1-d6c4f1d96fc7","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.869197Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:dc935b01463d36e56db0d14c6503f49f99be0d27964e71b3cae7466a1e00c715","observation_id":"51a192e9-c3b7-48e5-acff-21624f1775ce","resolution":{"observed_at":"2026-08-10T20:22:29.964326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.947054Z","title":"Coun- terfactual vqa: A cause-effect look at language bias,","venue":null,"work_id":"1319abe2-d64d-4832-ace4-f1f6a22b4a40","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.872228Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0ed293552d54c79dbf2aa4883dcaceea6d2d6b387c72e414585b4dfc74abf0ea","observation_id":"a49e0de7-7419-402d-a33b-e09219841169","resolution":{"observed_at":"2026-08-10T20:22:29.951666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.934145Z","title":"Beyond question- based biases: Assessing multimodal shortcut learning in visual question answering,","venue":null,"work_id":"96b33bcd-d2d8-4059-8878-925b86b1e1ba","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.875299Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:978d433e45a3329ad9a08623a05e076c2e34fb6366094a283add570caa251527","observation_id":"e8864a2e-5808-40c6-b518-77ab0c08d48f","resolution":{"observed_at":"2026-08-10T20:22:29.938674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.921602Z","title":"Roses are red, violets are blue... but should vqa expect them to?","venue":null,"work_id":"34ece9e7-eed6-4a0c-820b-b2ede76428e0","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.878700Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:36b1d60fea6a0da0127c2579b7f61b70f4e2bd7aa27aaff885615bfd9d96be7e","observation_id":"d575a6f5-4b9f-4d92-b8cc-39f2a7f3baa7","resolution":{"observed_at":"2026-08-10T20:22:29.926218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.907319Z","title":"Human-adversarial visual question answer- ing,","venue":null,"work_id":"c41bd97d-1073-4f46-8fc5-6d4e7b7f3cab","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.882176Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e931c4995dea48b69132bebca4126a4bf2c8d2f7e0adba2a48d1c21ac832e970","observation_id":"b2019ef5-2c84-4f92-a84e-c247a7e3a4d3","resolution":{"observed_at":"2026-08-10T20:22:29.912538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.894173Z","title":"A survey on curriculum learning,","venue":null,"work_id":"2c638428-c145-4e7e-b428-5a9d72b05709","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.886366Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d02fd2853df3c89bcf7f517990da3cfe29f426c92433d76753296881f0fb93c4","observation_id":"4e026506-d2ad-4521-ae3e-6cad9a0e5ec7","resolution":{"observed_at":"2026-08-10T20:22:29.898588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.889818Z","title":"Curriculum learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.889818Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7c6a2de16b13acfaa2dda36c36dbb8a347f751b802ad9acb8d0785c548b85049","observation_id":"3e8ded24-e28a-4311-8830-2aeb40d69a6b","resolution":{"observed_at":"2026-08-10T20:22:28.889818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.874074Z","title":"Tgif-qa: Toward spatio- temporal reasoning in visual question answering,","venue":null,"work_id":"572a61cd-edfa-4f32-a029-34a618273a41","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.893376Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:13d1e642647c51179f21ddb8ff5ad11a8a5a1850afc21bbc60571c0824a06c39","observation_id":"d0b6f7db-8ade-4e59-ac02-3bccd89b6f9b","resolution":{"observed_at":"2026-08-10T20:22:29.878483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.864294Z","title":"Revisiting the","venue":null,"work_id":"be1bd2f9-7b91-4d5c-b555-5fc02d7db23f","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.897187Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:6a980017a418e4cf1b18a862903dfe037044a93bf71d2a54c8b9143fd0fc339f","observation_id":"bb3893a4-465a-41e6-85a1-5026b5dd85fa","resolution":{"observed_at":"2026-08-10T20:22:29.867380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.901073Z","title":"Answering from sure to uncertain: Uncertainty-aware curriculum learning for video question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.901073Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:57b48cb6a8d463603da574b8316d295eef869c91bd39d65dbee45ac552ca2e0d","observation_id":"b2da382d-c2bd-44d2-9171-27d8ee531a5f","resolution":{"observed_at":"2026-08-10T20:22:28.901073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.854093Z","title":"Question-guided erasing-based spatiotemporal attention learning for video question answering,","venue":null,"work_id":"249534c5-e73f-4cce-bd0c-d8ba145b0aca","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.904741Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:91131167816b3edbee20fed92adb0740168ebdf9da0725d3dd419b569ebd250a","observation_id":"e2a152b2-a62d-42ff-86cd-e1328346f135","resolution":{"observed_at":"2026-08-10T20:22:29.857861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.842626Z","title":"Memory augmented deep recurrent neural network for video question answering,","venue":null,"work_id":"dce143b0-db34-4e36-9a0f-fed756fbad2b","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.909220Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:74ea8f2bff53decc18c74e7582c67fa3bbfc7f67543d9c369ed99d1937f5327e","observation_id":"06093558-5918-49fd-9669-f538d0ec5d5f","resolution":{"observed_at":"2026-08-10T20:22:29.846939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.831515Z","title":"Knowledge-routed visual question reasoning: Challenges for deep representation embedding,","venue":null,"work_id":"ba2687e9-9573-4636-83ae-423c482d0528","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.913520Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:01d042b901587c6de37821a6dddb1f00d420a59988e871312377dc2c650f3a3f","observation_id":"431db470-deaf-48f4-a4fe-75b4f3d4abc5","resolution":{"observed_at":"2026-08-10T20:22:29.835410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.819366Z","title":"Multitask learning for visual question answering,","venue":null,"work_id":"d45854a8-6441-4011-9911-de7f046b1033","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.917336Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:015a785b7491be37af332d82b2ed0161b106fae8f3492c0f8f16c7a9db6243a1","observation_id":"b3be0ff1-18e9-4203-8bcf-5a412b7c57d0","resolution":{"observed_at":"2026-08-10T20:22:29.823215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.808027Z","title":"Bilinear graph networks for visual ques- tion answering,","venue":null,"work_id":"f641a0a2-6b73-4360-9cca-85d820d39d20","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.922428Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:2ba538bdab6422fce63889bab23a08f1f134317f61917609c56960492cce4336","observation_id":"b830ec11-203f-4216-b2f6-8cabae86c334","resolution":{"observed_at":"2026-08-10T20:22:29.811946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.796170Z","title":"Bilateral cross-modality graph matching attention for feature fusion in visual question answering,","venue":null,"work_id":"39df76ef-abc0-49a6-95ee-681d9d08c80d","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.925840Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:99b961517a09ef0abe8cc2ec465b787ff8de09c098e13a670c83d85278801ba1","observation_id":"a36e2dd3-5034-466a-8c1f-e7fd57e0df58","resolution":{"observed_at":"2026-08-10T20:22:29.800548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.783411Z","title":"Bridging the cross- modality semantic gap in visual question answering,","venue":null,"work_id":"3add33f7-5257-4185-bbeb-cd25e3a2117b","year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.929126Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:a05dffb977978567798ff94a8ec6cd6b24a2455f845e0591d86506da1b890d21","observation_id":"45178bf5-0eb8-414d-9906-9416d950a396","resolution":{"observed_at":"2026-08-10T20:22:29.787587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.772236Z","title":"Latent attention network with position perception for visual question answering,","venue":null,"work_id":"c871a682-0ae9-418a-83be-324002711e80","year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.933066Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7171f4c5d3399bdd8a50da1c052872f4b65ad710246786bdeb317520403aeec2","observation_id":"cc25a2d1-e088-44e7-9b65-4fd7ae5029a7","resolution":{"observed_at":"2026-08-10T20:22:29.776048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.760976Z","title":"Webly supervised knowledge-embedded model for visual reasoning,","venue":null,"work_id":"934f4bda-bb9d-4df5-92a6-900fa6b39f36","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.936324Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:db6938d6a8a742f22781b9053926364b97e8ce768f1002e9433ed6665f36728a","observation_id":"aac3d65f-0e70-4238-9cc7-daabc6288571","resolution":{"observed_at":"2026-08-10T20:22:29.764674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.748675Z","title":"Uncovering the temporal context for video question answering,","venue":null,"work_id":"8af4f475-7c7e-4fe8-a357-9a2079d656a1","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.939590Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:adfcf8de0392bc2722ad614a21aa3e2feff8f42bbb44eb1329260d32e02be0c9","observation_id":"c7110ae4-0f09-434c-9d73-442c8d76815b","resolution":{"observed_at":"2026-08-10T20:22:29.753036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.736219Z","title":"Video question answering via gradually refined attention over appearance and motion,","venue":null,"work_id":"a4572aa1-cd9c-4373-a286-35b871cd0c95","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.943213Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:bdb87bf4fb0a44a417db20ffd0a21004fee60b646e40d96d2bb9becc0f025272","observation_id":"8d3ecdae-de28-48e3-8d52-27ad057b8c44","resolution":{"observed_at":"2026-08-10T20:22:29.740341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.723961Z","title":"Divide and conquer: Question-guided spatio-temporal contextual attention for video question answering,","venue":null,"work_id":"fbb510fa-4d1d-4201-865a-75762e23661f","year":2020},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.946761Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f823779dedd9c75c279a75e1bd93ce918802a13a6a199c7bfbbfd0a2094f8f26","observation_id":"863e8001-2d72-42b1-ad53-1526236563e3","resolution":{"observed_at":"2026-08-10T20:22:29.728219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.711979Z","title":"Video question answering with spatio-temporal reasoning,","venue":null,"work_id":"c739e7a3-8cda-455c-87a4-0f5010c773a1","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.950509Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7d0b36457e0e96d10d8cd66bc6372a0ca603a982cc102360b701ddb1e82ec3af","observation_id":"8dc85746-341a-442d-9ad1-b34a4b8fd5e1","resolution":{"observed_at":"2026-08-10T20:22:29.716195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.699837Z","title":"Dualvgr: A dual-visual graph reasoning unit for video question answering,","venue":null,"work_id":"a84a4b08-8a8e-4d09-8702-a78f2a6c1145","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.953955Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:fe2855b91cb099619c83665a4ac75cfca7811ce24251d518bfe55377108dc436","observation_id":"69e3270d-7c37-4141-9d1a-424baa1332d6","resolution":{"observed_at":"2026-08-10T20:22:29.704012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.687253Z","title":"Bridge to answer: Structure-aware graph interaction network for video question answering,","venue":null,"work_id":"bde9cc6d-47c0-459a-81d5-59c4c26dbcbe","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.957975Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3b5525140b58093f32421b2012382c6644f38a97638ab52bcba41abb9dbd3967","observation_id":"3cd45be9-6a74-4205-af87-22150a4fa54e","resolution":{"observed_at":"2026-08-10T20:22:29.691371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.675443Z","title":"Motion-appearance co-memory networks for video question answering,","venue":null,"work_id":"6364fe55-313c-4887-bcbc-e047a6972b9b","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.961511Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7ada9ad82ecfc5e89cb8b31f8c9643d476d5525e2bc78b2d4a1ecbab63d6e03c","observation_id":"bd0de087-f9af-47aa-a621-98dddf70774b","resolution":{"observed_at":"2026-08-10T20:22:29.679267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.664287Z","title":"Heterogeneous memory enhanced multimodal attention model for video question answering,","venue":null,"work_id":"fa9792b7-573a-463f-b405-12fd43b49849","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.964910Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:a2da32e680893df0ca26be0fa2f3b9730922eecd953c13f47657c25bf5e7765f","observation_id":"c1149717-3af7-4511-80d4-ea9312ec6448","resolution":{"observed_at":"2026-08-10T20:22:29.668248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.652646Z","title":"Hierarchical conditional relation networks for video question answering,","venue":null,"work_id":"4485da00-019c-4878-8bf1-24aa64299dfd","year":2020},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.968357Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:4fb90e5c2da13403fbac521609a3ee7c55315c737105d8ee68394cf3cd1cd638","observation_id":"0fc7a196-c301-474e-a175-c42904a5edbf","resolution":{"observed_at":"2026-08-10T20:22:29.656871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.641625Z","title":"Verbs in action: Improving verb understanding in video-language models,","venue":null,"work_id":"d93acb20-5942-4646-9614-de937ee4b88d","year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.971679Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:1a013920ed0d5b8309be5148bbfdc7fd4d2349204da4cbdc3161f3fe62d2aec4","observation_id":"e3cfb448-3188-4f39-a469-c80dc57ae182","resolution":{"observed_at":"2026-08-10T20:22:29.645191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.629585Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","venue":null,"work_id":"aad42667-600d-40b6-a4f8-ae5af8c9e06d","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.974963Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:8297498f0b076bb1d9c9509b63148b398f7ed4a10fcf4aa02f998484fb44eedc","observation_id":"42900346-0920-434b-ad7a-25087c9f9ff9","resolution":{"observed_at":"2026-08-10T20:22:29.633656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.978593Z","title":"Teaching structured vision & language concepts to vision & language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.978593Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d6d447950159aac1cdead9d2165857934eb5deb98432a9642fcd6d4e3e6353c3","observation_id":"aebf50f1-0815-48f5-981b-127bb796945f","resolution":{"observed_at":"2026-08-10T20:22:28.978593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.609750Z","title":"Rubi: Reducing unimodal biases for visual question answering,","venue":null,"work_id":"70608137-0c53-4cc4-9a9b-7b1e4b17445f","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.981805Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:e0e4e7da36399cf351a50be90c9cfb1bc7a5f15e35f9498894b0e8bf19fe0907","observation_id":"3a7f542e-94e2-4463-b39b-ce6ffd6f613d","resolution":{"observed_at":"2026-08-10T20:22:29.614069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.596280Z","title":"Don’t just assume; look and answer: Overcoming priors for visual question answering,","venue":null,"work_id":"82e1283a-e2b1-44fa-adfe-b521e7a9c4a8","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.985272Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:0a631633dd7bdaf88916ae2d03ef0024893e2feb4faa4214ff25e8d9bcb3c814","observation_id":"0390a37c-da9f-41b4-b8a0-51f726c37a2b","resolution":{"observed_at":"2026-08-10T20:22:29.600848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.584597Z","title":"Overcoming language priors in visual question answering with adversarial regularization,","venue":null,"work_id":"35e704a2-e415-4d47-879d-5f5df1bcd44c","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.988924Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:470046676aa202b0f3540446ec47045f51b4121e7ed6db838bc007f3135166ba","observation_id":"0ea48d93-d1da-411f-9aa2-eb29c500de50","resolution":{"observed_at":"2026-08-10T20:22:29.588740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.573110Z","title":"Reliable visual question answering: Abstain rather than answer incorrectly,","venue":null,"work_id":"31227152-18fc-4c49-80e6-a19f01ae0eab","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.992385Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:b73e9981d22ea990d1411c3394bda50263ba84be3231c0dcac44f267096ef0f7","observation_id":"2297cfd9-6abf-4134-9808-5ac885c7dc23","resolution":{"observed_at":"2026-08-10T20:22:29.577485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:28.996874Z","title":"Addressing failure prediction by learning model confidence,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.996874Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:748abe15e9484667c2c5a8f42873930b38ed658c0adf1a06e56b20c7a88953e8","observation_id":"889e1f67-fff4-4e59-aada-db3fe4670164","resolution":{"observed_at":"2026-08-10T20:22:28.996874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10964","last_updated":"2019-08-01T22:05:44Z","snapshot_observed_at":"2026-08-14T16:26:14.235192Z","submitted_at":"2019-05-27T04:00:51Z","title":"Combating Label Noise in Deep Learning Using Abstention","version":2},"cited_work":{"arxiv_id":"1905.10964","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.10964","snapshot_observed_at":"2026-08-10T20:22:29.176221Z","title":"Combating Label Noise in Deep Learning Using Abstention","venue":"stat.ML","work_id":"3c86718e-dca7-4bb6-8b08-47ed75bfcbf7","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.001019Z"},"links":{"cited_paper":"/paper/1905.10964","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:642c7769202d3ac5f4dd5444ad65490174466240cf6c535b756062a97e9c2f41","observation_id":"4b57a7cf-c70b-4472-909e-31cc9f10b7f6","resolution":{"observed_at":"2026-08-10T20:22:29.182883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.555812Z","title":"The art of abstention: Selective prediction and error regularization for natural language processing,","venue":null,"work_id":"0d8c6349-c696-4f45-8f57-9da7f2586966","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.004953Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f9e35392d27a99a6514edfce1a62fd55d4227b13e095e63328de3fc593d80f9e","observation_id":"ddf71bdb-f7d6-42df-ae1f-a2794b0077d5","resolution":{"observed_at":"2026-08-10T20:22:29.559720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.543745Z","title":"On the foundations of noise-free selective classifi- cation","venue":null,"work_id":"c9cadeee-eb55-4811-bd10-89d89bb7fbe1","year":2010},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.008397Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3cba8e6ec7bb03f53d063e81c9af3a50d2d7e866898877b2ee20423f25972487","observation_id":"7a613141-c7e7-461b-b55f-889d64a619b3","resolution":{"observed_at":"2026-08-10T20:22:29.547982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00211","last_updated":"2022-03-01T03:35:37Z","snapshot_observed_at":"2026-08-16T17:17:55.444508Z","submitted_at":"2022-03-01T03:35:37Z","title":"Investigating Selective Prediction Approaches Across Several Tasks in IID, OOD, and Adversarial Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00211","snapshot_observed_at":"2026-08-10T20:22:29.011509Z","title":"Investigating selective prediction approaches across several tasks in iid, ood, and adversarial settings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.011509Z"},"links":{"cited_paper":"/paper/2203.00211","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:7ca521ae5a43d153bc7f2230647949ab2614f687fd35be279f56240ab4e8c126","observation_id":"1379861a-8ac1-4286-ba1b-c9a08c13a3e8","resolution":{"observed_at":"2026-08-10T20:22:29.011509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.531346Z","title":"Selectivenet: A deep neural network with an integrated reject option,","venue":null,"work_id":"fb295660-db2f-4ffc-b0d2-a299fbf87c8d","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.015510Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d3c1661013c9e7b7ca7112e726117b222f888771a519917287546a5264f49509","observation_id":"3341b454-363a-46cb-ab49-62b3041d7861","resolution":{"observed_at":"2026-08-10T20:22:29.535581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.519728Z","title":"Selective question answering under domain shift,","venue":null,"work_id":"c8e7e465-5b23-4d2c-a28f-8a02dca5108f","year":2020},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.018882Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:8076d8eda353691af479e7f734fbf0ba543134a48a65b17e4cf5810f70dadb18","observation_id":"e151b0e8-61a6-4d4a-87b5-20442f4a437d","resolution":{"observed_at":"2026-08-10T20:22:29.523427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.022646Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.022646Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:dcd032f71b54eefbbf600b5af5e0f51e4fdf121b543ea9bd959bf02eaca3ee2d","observation_id":"1325e5ac-d15d-4ada-9316-a8365ef8b309","resolution":{"observed_at":"2026-08-10T20:22:29.022646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.026236Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.026236Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:421b97ed00a9bec95ffb0c44dabe25fffb9734f7c69ee385a7a3bb8f0f360902","observation_id":"0f449ef2-86c9-4a81-9fda-b7d70ecf11fb","resolution":{"observed_at":"2026-08-10T20:22:29.026236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.492301Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset,","venue":null,"work_id":"486cef4f-2f1d-42ca-8623-9aa6a16bc2d7","year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.029742Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d266b96dbf7af06716274e873d01d552f0bec978a3a9a6f24e35c6e52b529397","observation_id":"2f469043-f51d-4d8e-8e30-0a21a2fb13e7","resolution":{"observed_at":"2026-08-10T20:22:29.496535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.480688Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips,","venue":null,"work_id":"d0de6002-5d96-4e50-bc9a-a3bfa896ae8a","year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.033198Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3d87c9f79f6955acbfbff41f6a83c2a7c809a29c9811f0fa2c7c33d9233c1b1d","observation_id":"99d0fe4a-e38b-4ac0-8e79-f35b8e9f8117","resolution":{"observed_at":"2026-08-10T20:22:29.484728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.469212Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions,","venue":null,"work_id":"d4103055-2711-4043-b409-f57979918ff6","year":2018},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.036935Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f86f91ef9f22a39d35d1e02b0aef8e850ca70ca27a566fd26a974b215e09c6a3","observation_id":"094aa94b-d13c-4553-bd4a-22f3d69d4f8f","resolution":{"observed_at":"2026-08-10T20:22:29.473291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.457587Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"30296b43-b3ff-4bec-aeeb-96e30033955a","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.040850Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:ad1ef48e404a352dfb40ccff97c91e465ed42969228575fe45e3fbec47cc238c","observation_id":"999faf4b-2dce-45c4-9888-1b0b1c780e61","resolution":{"observed_at":"2026-08-10T20:22:29.461656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.446011Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions,","venue":null,"work_id":"6a581a1d-3fc3-46ee-9ab5-3f57068c2c9a","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.044658Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:5f606acc1529bebb83841cf2532f56dbf2ff3e4165241b738838db3ce120fa29","observation_id":"edf1e6c2-5324-4e8d-a7e5-b820685d25e4","resolution":{"observed_at":"2026-08-10T20:22:29.450128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13432","last_updated":"2021-08-25T11:36:26Z","snapshot_observed_at":"2026-08-16T18:14:36.090994Z","submitted_at":"2021-06-25T05:12:42Z","title":"Hierarchical Object-oriented Spatio-Temporal Reasoning for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13432","snapshot_observed_at":"2026-08-10T20:22:29.048239Z","title":"Hierarchical object-oriented spatio-temporal reasoning for video question answering,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.048239Z"},"links":{"cited_paper":"/paper/2106.13432","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:d19a9d881bb0b25cae74854fdae58f4c1c113fefc2a83dbd33ea1259f5f729f9","observation_id":"21650f3e-d479-4a7f-9edc-e1f891b68af4","resolution":{"observed_at":"2026-08-10T20:22:29.048239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.434175Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":"ea9219fa-3207-46b3-86ed-13cd5178b47a","year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.052228Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:65d63bff1ccc0302e4eb3bcc24efcd576f9246b19c5561973452946b967ec2b7","observation_id":"ad5ab970-1c3d-4c30-b94a-cfb9e4e2cd4f","resolution":{"observed_at":"2026-08-10T20:22:29.438477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.055862Z","title":"Causal inference in natural language processing: Estimation, prediction, interpretation and beyond,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.055862Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:1bca264eef55119cf0ae7c5d30e2dfe8f321737a6179d29a51ccbc03a928ba25","observation_id":"adbb3e57-2533-42ff-9de2-c5893e946466","resolution":{"observed_at":"2026-08-10T20:22:29.055862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.415795Z","title":"Docogen: Domain counterfactual generation for low resource domain adaptation,","venue":null,"work_id":"37ad3afe-327c-47cb-aba1-72382172cfc6","year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.059587Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:c0879519999854f83eb539352168522edf35c5922e5943b926b3a7670608da3f","observation_id":"758ebd2b-997d-491a-9a43-aa119f008327","resolution":{"observed_at":"2026-08-10T20:22:29.419757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00288","last_updated":"2021-06-01T17:13:45Z","snapshot_observed_at":"2026-08-16T18:54:45.032230Z","submitted_at":"2021-01-01T18:34:22Z","title":"Polyjuice: Generating Counterfactuals for Explaining, Evaluating, and Improving Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00288","snapshot_observed_at":"2026-08-10T20:22:29.063214Z","title":"Polyjuice: Au- tomated, general-purpose counterfactual generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.063214Z"},"links":{"cited_paper":"/paper/2101.00288","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:54ced2f932f11d0c4c924d353d94f2ebeab894cf9c7806a72d392f958b1e894c","observation_id":"4967e378-4854-41ca-bcab-a0c2b723200c","resolution":{"observed_at":"2026-08-10T20:22:29.063214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.067137Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.067137Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:865f46a5ebba4ce98b1a59a371932d25df31b9f2979aac5b040924f0dcfda5ee","observation_id":"3c9abe9d-38ec-438e-a2fc-2ae6b0974985","resolution":{"observed_at":"2026-08-10T20:22:29.067137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-10T20:22:29.070599Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.070599Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:09d6f9371ac6469f11dd4b4ebd4e9b2045da05bc2889af3025b257716099f859","observation_id":"e7017573-60f0-4102-aeb3-ff0fc7b0940b","resolution":{"observed_at":"2026-08-10T20:22:29.070599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.074601Z","title":"Stacked attention networks for image question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.074601Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:3c0a69202277c22bc2950c803ff2b3b95598b5503913a5149e451dc66e379f09","observation_id":"3c5a5043-d24b-441b-9a3e-7133004cc6ac","resolution":{"observed_at":"2026-08-10T20:22:29.074601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.389302Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding,","venue":null,"work_id":"c8cf697c-638e-4550-a53b-b52a0c4caf5b","year":2016},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.078064Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:684bec8fd31bc99843a38833409e9a031bb8b7645d7994d14c0aa5175c3e1e86","observation_id":"f693dfea-2e83-4e8b-9452-b39d8a32a65d","resolution":{"observed_at":"2026-08-10T20:22:29.392912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.081042Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.081042Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:f07424403c86dfb786715acd66cacac504ba491945ceab91bb5c52ccfbd491d2","observation_id":"d2d1af64-df40-4420-9a50-aa37acd053a1","resolution":{"observed_at":"2026-08-10T20:22:29.081042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.083891Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.083891Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:5603978e29aac4cdf7f8cc2ca36db16e3705edb7289bc8cfdf37032869c85b09","observation_id":"eceb8198-17c8-4dd0-993a-e8d068f6e578","resolution":{"observed_at":"2026-08-10T20:22:29.083891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:22:29.364114Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"d871319b-fa2e-4bba-bbca-e42ae93bc875","year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.087051Z"},"links":{"citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:c053c91b3d2056da4614cb586f9fe33de2bdb7204cfc9454a6907e9d8af51da6","observation_id":"2abc7e2f-be50-408b-a452-3a954810dc27","resolution":{"observed_at":"2026-08-10T20:22:29.368636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T20:22:29.090022Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:29.090022Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:10da6fc66d50b8733ac0893d69e8deb1c35c2b8b790e1bb2d36b268c8587ad91","observation_id":"2938132f-fb81-4bf3-b4bd-7aa0e143015e","resolution":{"observed_at":"2026-08-10T20:22:29.090022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T16:19:42.326360Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":55},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2501.08771."}