{"as_of":"2026-08-18T08:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06d0a7bd3428f4553dee0ee1c95d4b29e6b7b1d1d7466ed368990c7c3229ce19","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:40:40.564012Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:16:07.090870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T08:16:47.773102Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"cited_work":{"arxiv_id":"2508.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19650","snapshot_observed_at":"2026-07-02T08:16:47.773102Z","title":"Video-levelgauge: Inves- tigating contextual positional bias in large video language models","venue":null,"work_id":"ecad2dfa-cb2e-49be-b05c-665143e1967b","year":2025},"citing_paper":{"arxiv_id":"2605.19322","last_updated":"2026-05-19T04:02:01Z","snapshot_observed_at":"2026-08-02T06:11:11.606278Z","submitted_at":"2026-05-19T04:02:01Z","title":"DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T06:55:01.619441Z"},"links":{"cited_paper":"/paper/2508.19650","citing_paper":"/paper/2605.19322"},"observation_digest":"sha256:e6d50dc1a2c4b16e5b19659a30a557381e9b8738706843c78b9448dfbf290f58","observation_id":"1bfb9d1e-a881-429b-9703-92f7ff47c0af","resolution":{"observed_at":"2026-05-20T06:58:05.983666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"cited_work":{"arxiv_id":"2508.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19650","snapshot_observed_at":"2026-07-02T08:16:47.773102Z","title":"Video-levelgauge: Inves- tigating contextual positional bias in large video language models","venue":null,"work_id":"ecad2dfa-cb2e-49be-b05c-665143e1967b","year":2025},"citing_paper":{"arxiv_id":"2606.05008","last_updated":"2026-06-03T15:28:57Z","snapshot_observed_at":"2026-08-06T07:23:12.183499Z","submitted_at":"2026-06-03T15:28:57Z","title":"M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T06:16:07.090870Z"},"links":{"cited_paper":"/paper/2508.19650","citing_paper":"/paper/2606.05008"},"observation_digest":"sha256:6c959dea3d88f8619e25a4857b6f0c2024bc17a1c85c6405438f4ad32aad4d59","observation_id":"d29541e9-3524-4b6a-a74a-0cb96578d36d","resolution":{"observed_at":"2026-07-02T08:16:47.774503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19650/citation-record","integrity":"/paper/2508.19650/integrity","json":"/paper/2508.19650/citation-record.json","paper":"/paper/2508.19650"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-05T15:40:40.375797Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.375797Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:1c0e0a3daee3d894d4d28027ce5437e3ce7c52c9befd9c1cce0d77db00187d10","observation_id":"65e74ff3-ca57-4317-b64b-72922a10f5e6","resolution":{"observed_at":"2026-08-05T15:40:40.375797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.321303Z","title":null,"venue":null,"work_id":"397505bb-8b49-4ec3-a599-f07acd6f3c90","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.379826Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:36f9d2718ad83ccfd144fae12dbeeffcbdd0391b5076270cfe91009723402fc5","observation_id":"b145b217-8f77-4661-b58a-012bfb679beb","resolution":{"observed_at":"2026-08-05T15:40:41.324211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.312731Z","title":"Claude-sonnet-4","venue":null,"work_id":"adb839d4-0376-4823-9474-1cf078df4dfd","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.382974Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:2049286f1c8ed92542b66a4e60daaa75be6e6ca16ea637ff7ba3360dcee255e1","observation_id":"37c1ab81-66d2-4275-8218-f814e6f8b074","resolution":{"observed_at":"2026-08-05T15:40:41.315764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.303412Z","title":"Minigpt4-video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens,","venue":null,"work_id":"ca032ef4-4ea8-4ef2-962d-44bbc421ff89","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.386685Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:655ae720257e361bffaa4310c07b2bddc1271715b33170ae8f266b8de578c982","observation_id":"5689d440-2051-4c0b-bc89-e1e4b1c65b74","resolution":{"observed_at":"2026-08-05T15:40:41.306761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.294390Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"21200064-d011-4268-9d80-f60c95cded98","year":2023},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.389989Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:1d7c28a13332cb4382c3a33da0784196dc7c6af81e1b1fb21cac389b905c71de","observation_id":"2bece409-1543-4315-8abb-85aba8fc7f43","resolution":{"observed_at":"2026-08-05T15:40:41.297697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T15:40:40.393101Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.393101Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:91611a87c4a28e7e4710e5cec69669b8a6f061ff6c6b8086b04eca3fd986c5df","observation_id":"059fc12a-ced7-4d08-af87-903701ead891","resolution":{"observed_at":"2026-08-05T15:40:40.393101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.285587Z","title":"Doubao-seed-1.6","venue":null,"work_id":"8e83d98b-1d92-4a13-871f-0e046491b1f7","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.396513Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:73fdbf47ef2919f8f956aeeda3be4c0edac1233cba16953bc67477afa4e941e0","observation_id":"c353df1a-85d1-4771-aa1b-1739b7ecfa43","resolution":{"observed_at":"2026-08-05T15:40:41.288645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.276707Z","title":null,"venue":null,"work_id":"8cb38a33-ada6-4441-9c9f-15573165e634","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.399914Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:ce053b9383761f5352a5224407747dad035640818059f080d533970778d5b4f2","observation_id":"8b13b3b2-8aa9-48d4-a1ed-33d456936220","resolution":{"observed_at":"2026-08-05T15:40:41.279774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.267189Z","title":"LongVILA: Scaling long-context visual language models for long videos","venue":null,"work_id":"739dd074-d828-480a-94de-f5d34422d7bd","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.402904Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:5a0fda465c9c439dc578b5daff5e55c271d605b8795b41e310c73e515d775136","observation_id":"ce52ab39-d687-408f-801d-df85a4ecd06c","resolution":{"observed_at":"2026-08-05T15:40:41.270684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.257449Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms, 2024","venue":null,"work_id":"8b547e8f-44c2-41a6-91f0-e61e856b712a","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.405886Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:e39abb16d842835d4a354547c1fb6e09f4ba195d0efa949dd25127bf449f59dd","observation_id":"1b2fed83-7c48-4c90-bd44-ae8aa70838ac","resolution":{"observed_at":"2026-08-05T15:40:41.260969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.248414Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic ca- pabilities, 2025","venue":null,"work_id":"a5c2c4f2-9a53-4c14-bb94-8d3157e9fcb9","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.408752Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:de28cd7f758bf3c7df8d16bc3f1bd0c69ec567df7597b861e6780bdbb668a0e3","observation_id":"9d43fce6-8ccf-46cc-b5e3-cc9bff5c269d","resolution":{"observed_at":"2026-08-05T15:40:41.251670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.239230Z","title":"Video- mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"749b93bd-2c3b-40c5-8ea8-80c9d527e5f9","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.411871Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:4e159898c8a8ea4c82a5f7d41544fea0c2e3e71a09991e8fed400770e6a411c7","observation_id":"f5ab3313-f21c-47f7-864e-7f20a81a650e","resolution":{"observed_at":"2026-08-05T15:40:41.242533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.229999Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"29c971f4-eb59-4a17-9a9e-2c98b11a5e62","year":2022},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.414832Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:a243ecf62a828336d227d3a2ffd3748390e03f78456b9c16dd7b861c699d579d","observation_id":"ea51068d-30b1-43a7-97ad-ad4c47deb42d","resolution":{"observed_at":"2026-08-05T15:40:41.233387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.220828Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"b6a7e68e-0ef5-49b1-b1dc-ddbd3cbeab79","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.417531Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:8f1c9dd4b7031919cfeef5305c6613adf55591ae10787246968aaa68ce7aac26","observation_id":"00566207-44b0-4dc9-9499-bec7e5bbe829","resolution":{"observed_at":"2026-08-05T15:40:41.224035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T15:40:40.420423Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.420423Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:96677ec3468777d2045915352e91eff8a8b26c35778257b44450bbba1d47e2e8","observation_id":"2307a43e-3c88-4356-b064-ede6b14e023f","resolution":{"observed_at":"2026-08-05T15:40:40.420423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.423571Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.423571Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:c62937a835b2a51eaf768e9053127a86cfaef60f08de3cc4fc230d6fcfde62c0","observation_id":"b9dc044b-cff9-4370-b2ce-6b458c9ccfb6","resolution":{"observed_at":"2026-08-05T15:40:40.423571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.206481Z","title":"LLaV A-onevision: Easy visual task transfer","venue":null,"work_id":"6c9f6b4c-6dc8-42f1-ad06-daa5cfecc3d7","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.426686Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:4ae6b2ae7404f205536e9445326482fbd5ab3361a7cbce416d53d243945ebe49","observation_id":"1f10baab-a03f-448b-bc7f-5ebb11321d01","resolution":{"observed_at":"2026-08-05T15:40:41.209634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.198102Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"b7675063-5c7a-45db-9dc9-8733305e24e4","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.429618Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:20bde3f724c022ed1d02bbc72e82c4fdb620713dc53c09740f1c776508bfb226","observation_id":"dbb12601-14cf-4791-b2e6-2e166ac5db85","resolution":{"observed_at":"2026-08-05T15:40:41.201130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.188936Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"74b82d9a-bca8-40c4-9f8f-bd5a5c046cdf","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.432539Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:192902e7b11a7f20c6d5ecada2203d17fb1701cf47443128f2c1f5d1da6b798b","observation_id":"1fc36da3-17db-4a3c-826c-a94a1c94c0bd","resolution":{"observed_at":"2026-08-05T15:40:41.192619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.180305Z","title":"Video-LLaV A: Learning united visual rep- 9 resentation by alignment before projection","venue":null,"work_id":"9f703f53-517a-4e17-8afc-6dc6f425e9ef","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.435609Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:90b1b423af153fa6106eeb6a7d92cea8c4422bbaa40b18778eef69f1e589247a","observation_id":"a871293f-60e7-4828-a97a-939032e264de","resolution":{"observed_at":"2026-08-05T15:40:41.183525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-16T13:23:18.747171Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-05T15:40:40.438516Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.438516Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:85d20e101cd8735554dd3df88a32f66aba2cffea26f858bb3abff37f1c2f21c7","observation_id":"adce1126-a8a0-4236-b4ca-617e4f826596","resolution":{"observed_at":"2026-08-05T15:40:40.438516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.171547Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":"706a336e-46d6-488b-ba4f-cbe128620848","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.441934Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:35fb8d4cc026ac8af653f066d4b98d8501a29ee6e08ef7d4d99c9745c0dd1332","observation_id":"38c45cc1-d510-49ce-b333-a65a322c07fd","resolution":{"observed_at":"2026-08-05T15:40:41.174770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.162430Z","title":"Scaling laws of rope-based extrapola- tion, 2024","venue":null,"work_id":"df2a9486-175d-4339-a36f-3afb91aaf9b1","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.445184Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b7d0f9796d5702971f45838a14b3b8e2f9ffd8e11dd59fb2e7f3db0acf454fb5","observation_id":"af6c663a-86dd-4ae8-b784-9963b6deba10","resolution":{"observed_at":"2026-08-05T15:40:41.165563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.153188Z","title":"TempCom- pass: Do video LLMs really understand videos? In Findings of the Association for Computational Linguistics: ACL 2024, pages 8731–8772, Bangkok, Thailand, 2024","venue":null,"work_id":"d7756937-df45-4a43-a4f0-be2fbb6748fa","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.448237Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:970b26494092ad4e98b42b7e01c3448324e61991e36b2d74830b3bd065b0107d","observation_id":"6753fc71-50bc-4a1c-9b66-c935817c839c","resolution":{"observed_at":"2026-08-05T15:40:41.156567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.144386Z","title":"Nvila: Efficient frontier visual lan- guage models","venue":null,"work_id":"5a7a5fce-8ee9-4065-8b74-1b0d91da6cff","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.451552Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:d4ea72ee447905a02d7786f8f4c63336422663ae4033830bd3adbaecb3b81b71","observation_id":"d7681b96-e8d3-4c04-88e3-5b215a9226eb","resolution":{"observed_at":"2026-08-05T15:40:41.147633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.134761Z","title":"Nee- dle in a video haystack: A scalable synthetic evaluator for video mllms","venue":null,"work_id":"81c07a08-6234-464d-9174-7ca767185e9f","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.454556Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:3186e1c64d289f5f1b5ac17e087a1a7a1489e0db33d77bd1d5f7225ea3e50b4b","observation_id":"a0edd6fb-bef5-477d-9122-9dd90f9cbd0e","resolution":{"observed_at":"2026-08-05T15:40:41.138613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.125241Z","title":"Video-chatgpt: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":"17182010-bedd-4e1e-98e9-150837ec8e94","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.457639Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b5c24a00a89e31dd0e0ad6d72cf9b0892be1a16474be24a1aac4fa4584fb138e","observation_id":"dbd00143-8289-4c02-8ecb-57b2ec42e662","resolution":{"observed_at":"2026-08-05T15:40:41.128830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.115297Z","title":"The serial position effect of free recall","venue":null,"work_id":"ac1c69bc-0b18-4636-b669-69edc992b3a1","year":1962},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.460901Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:bfecaa9ecaf7c8f1870bc8e4f4f61f381452290f84e5aebb00f351a26cd688e4","observation_id":"b27ab64c-bbdf-4ef0-90ff-b9379f5b0262","resolution":{"observed_at":"2026-08-05T15:40:41.118795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01437","last_updated":"2024-07-12T17:20:34Z","snapshot_observed_at":"2026-08-16T13:38:02.935764Z","submitted_at":"2024-07-01T16:32:16Z","title":"Needle in the Haystack for Memory Based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01437","snapshot_observed_at":"2026-08-05T15:40:40.464235Z","title":"Needle in the haystack for memory based large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.464235Z"},"links":{"cited_paper":"/paper/2407.01437","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:1928494dec003b5c02f2d0b6388d6fb5eae97b7ba8bc1fa1301f62529be7768b","observation_id":"ab257ea7-ec9f-4d31-9354-ee63024834ad","resolution":{"observed_at":"2026-08-05T15:40:40.464235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.106247Z","title":null,"venue":null,"work_id":"620732d4-f33d-4843-b4f0-778b363c4038","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.467639Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:7d202ccd13a2c8455414b59599ce3b9193ae77c0d9ff815d1cf8184c4689aff1","observation_id":"d8901391-803d-4ff6-b76f-753967c912c4","resolution":{"observed_at":"2026-08-05T15:40:41.109398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.097187Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"0ecdd599-4f98-43a1-8d74-d0cf944fbbf1","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.470740Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:fbb8cbd5dd19fb460e64fdd21e4f1034b492ee3793a61c273b221aabba953b56","observation_id":"9c773163-96be-4efa-9531-554b984c2f0e","resolution":{"observed_at":"2026-08-05T15:40:41.100555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.087709Z","title":"Too many frames, not all useful: Efficient strategies for long- form video QA","venue":null,"work_id":"165b1461-bcf8-4db6-b04b-45c93a1f375b","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.473979Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:68882b0b09887ee4d6c0f4db96b6348aafc427925bfa1a32951569c1a36ae0cb","observation_id":"4605b57d-522c-4e9d-b7b3-845e14079c8b","resolution":{"observed_at":"2026-08-05T15:40:41.091034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-14T14:43:02.885779Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-05T15:40:40.477147Z","title":"Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification.arXiv preprint arXiv:2506.19225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.477147Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:ef636854a7c5eedd0cc0245f0f65af6630f2d1d337664ccf0d6a42976623cf8f","observation_id":"bb56a904-e9af-4aa6-bde5-e33822a78dcd","resolution":{"observed_at":"2026-08-05T15:40:40.477147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.078495Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding, 2024","venue":null,"work_id":"f3f9184f-705d-42be-8d4f-3834e043f432","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.480593Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:695c10a93e1ae06786145594284dddca085508fbe0b434d9a73bea64fe623211","observation_id":"09913029-dae3-4a30-9500-59136aa2bbb5","resolution":{"observed_at":"2026-08-05T15:40:41.081785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.483719Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.483719Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:58a695488262a74ff545001ea1f7a8bce0cafafee9e7c31403d804da3c8ea68d","observation_id":"e6cce75b-3f48-4e2e-aa07-a121e0e2311c","resolution":{"observed_at":"2026-08-05T15:40:40.483719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.062280Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":"46eafa33-92f9-48ce-a2e6-a8bd9e1c4ee8","year":2018},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.487027Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b5d0ab4964c633422e7c62a9a4597c015a1db403c864c6115c3ebc907cac0d8f","observation_id":"99f41bf0-272c-438f-aee6-58fabe8059a7","resolution":{"observed_at":"2026-08-05T15:40:41.065754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.051852Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":"b2577f96-4252-4ebc-a921-03c17c188058","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.490189Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:17b6c0b460aadf7c4ef3b1ec1cc2924ee37198f6dde82b0168a23e5e8791b459","observation_id":"d376f8ca-6071-4fce-ae16-dbcbd90f2658","resolution":{"observed_at":"2026-08-05T15:40:41.055225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.041509Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":"7761d33f-87d4-4868-836c-ad49d74ff810","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.493475Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:22e846ed2371a8d8a9506486bb4b37df756ad1e3961a16121d2b0c61bb42311f","observation_id":"e1c435f9-c960-4abd-ac46-0f9a93d2e30d","resolution":{"observed_at":"2026-08-05T15:40:41.045168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.031227Z","title":"Multimodal needle in a haystack: Benchmarking long-context capability of multimodal large language models","venue":null,"work_id":"bf1cf9a3-0bbd-4511-9509-481560f1401f","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.496721Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:a8cb62e0c904b37744b8902fc48b6bd7ae0be815f8f04fd3ce25be826dcc61cb","observation_id":"5170d3ad-81ff-486e-9603-2d99133f9c50","resolution":{"observed_at":"2026-08-05T15:40:41.034671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.021039Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":"63ee2c56-91cc-4ad2-9087-24a5310c2bfc","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.499800Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:50a73fee2ad4dadb48c3d8fdafedfd82e08eb2eb51742f162cf7188620a38d16","observation_id":"9ce82354-d169-42d4-b055-f69ac1ffb12e","resolution":{"observed_at":"2026-08-05T15:40:41.024585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.010912Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"3c904e16-8959-4ef1-bb52-1bc945ad2be9","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.503121Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:71d6801ce56dbf4abc3c2d3249dc5fc606fd34f068cfc8c7e82b6c2331b71718","observation_id":"32b649c9-7fce-441a-b8e3-b0e6c0690088","resolution":{"observed_at":"2026-08-05T15:40:41.013993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:41.000721Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"16962511-9323-4dd4-80b5-9115eb499d7c","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.506176Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b0c39ea3cb30197184dd953c54e0c9369e588edd903d623d98e558f71999c592","observation_id":"a6e007d2-b029-4615-9b19-1fba9a0470be","resolution":{"observed_at":"2026-08-05T15:40:41.004212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.989675Z","title":"Mit- igating object hallucination via concentric causal atten- tion","venue":null,"work_id":"f93d2ef5-25f0-460a-80fc-928b3f7609ab","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.509168Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:165fa18c5789d5e0286d5116534bc6ec59ff08a7e435686b86cffd5f31efd46a","observation_id":"92174007-f620-44f5-b9a0-82522511e19b","resolution":{"observed_at":"2026-08-05T15:40:40.993509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.979743Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":"272ebe29-88b2-4e81-9a93-7b9000fd81d2","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.512623Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:c50774a884077b71647c21d0ddf49c10d8f15523d4236a80e7c61f66e9b59084","observation_id":"84336aff-ced5-476d-8666-c87a70868ed4","resolution":{"observed_at":"2026-08-05T15:40:40.982894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.969450Z","title":"Re-thinking temporal search for long-form video understanding","venue":null,"work_id":"91be93e6-4309-47b9-89f1-8f54181a831f","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.516157Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:d2de77ef4511f26eaa1b80c91fa562dad46ec92cade81729cc8a5ad45ad8bf06","observation_id":"f5b55030-f5c0-4c8c-9071-6ce23f26e5fd","resolution":{"observed_at":"2026-08-05T15:40:40.972907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.519503Z","title":"Lv-eval: A balanced long-context bench- mark with 5 length levels up to 256k","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.519503Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:e192a028755d0a02beac605d183b0acd856cb2463135798d6cf4249e65e3fd26","observation_id":"1e268707-996f-4d21-abc5-7fba0a759ac6","resolution":{"observed_at":"2026-08-05T15:40:40.519503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.958925Z","title":"Videorefer suite: Advancing spatial- temporal object understanding with video llm","venue":null,"work_id":"a4579493-0425-4160-894f-6ae8ee8932ef","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.522801Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:098b0978459cf3073cca63a84fbd5dd80439b12f830215816592da1ab8fb2625","observation_id":"9da279b6-3d77-42df-979f-b468a4b7351b","resolution":{"observed_at":"2026-08-05T15:40:40.962573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T15:40:40.525881Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.525881Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:62b24bc806850a1e2fba7de445cc08b9cd73fb32de8466ba31361585384eae04","observation_id":"a6aeea15-5916-4ff5-9296-8ba06b9838ef","resolution":{"observed_at":"2026-08-05T15:40:40.525881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.948371Z","title":"A simple LLM framework for long-range video question-answering","venue":null,"work_id":"0d06dba4-1a6d-4943-861e-c1c2f1b67d1a","year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.529685Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:0a6e2a760e9a35dbdaff1e2d3a26e56512d57f6314d12fbc0d95ef33670ca5e2","observation_id":"f74b40df-1c1c-4347-b75b-3322c6cf4af1","resolution":{"observed_at":"2026-08-05T15:40:40.952156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.938112Z","title":"Long context transfer from language to vision","venue":null,"work_id":"eb61f42f-86b5-45ba-826c-662f770fe563","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.533027Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:432b725326f32c266fb61547bb0040e161737793887ede0eb5cec814b36108ce","observation_id":"5ef51ecc-6e95-4b19-a3be-6fbefba61492","resolution":{"observed_at":"2026-08-05T15:40:40.941578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-05T15:40:40.536185Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.536185Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:cd41877ee601de3bb43ef84259e1c9068972dce75e20280c9df2d4323cb0bdb8","observation_id":"495fcdb7-43d6-4704-b7bb-7734549ef176","resolution":{"observed_at":"2026-08-05T15:40:40.536185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.927356Z","title":"Mmvu: Measuring expert-level multi- discipline video understanding","venue":null,"work_id":"918820c0-5c30-4eee-824e-a480613a3289","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.539944Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:51a2e927ecab0ec005fc52e85fc90a8672630e22a3e99781c71b3f7bbe53f8ff","observation_id":"c4ad9bb9-4dd1-4262-9ca1-62d36a96c2d2","resolution":{"observed_at":"2026-08-05T15:40:40.931073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.916534Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":"7b4af043-4956-4c4a-895f-83778a07f157","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.543150Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:659aa654002660685986e2030478ae729dfefd9deee7de865078c2d7e74b68d2","observation_id":"d365e751-59a2-4134-a938-4fcb7e40192b","resolution":{"observed_at":"2026-08-05T15:40:40.919974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T15:40:40.546410Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.546410Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:ab992f5d2241c32fe864856d4324e1ffd78a5c11acaa15c21978ea299149f775","observation_id":"5b09bca6-5e5e-4d1d-8e5a-92b3ea07ebcc","resolution":{"observed_at":"2026-08-05T15:40:40.546410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.905029Z","title":"Detection and tracking meet drones challenge","venue":null,"work_id":"fcb40a9d-3981-4ecc-8d3c-5da24507adf6","year":2021},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.549951Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:dd2fc1f2563df66b64fbfa99208f586a9b7e20a69a3e50621ea27d39776466cf","observation_id":"e7f879f7-f741-436c-a306-c62beb11157c","resolution":{"observed_at":"2026-08-05T15:40:40.908840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.893687Z","title":"Hlv-1k: A large-scale hour-long video benchmark for time- specific long video understanding, 2025","venue":null,"work_id":"8edf92ab-2b34-43e8-84d5-0952409cb656","year":2025},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.553142Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:150a38daa71a1177b91a9e73031b698d66ed4a871aa8c74b70a7e72872f014fd","observation_id":"7b3cf1e6-74a7-4c33-a225-b56aaea33ff1","resolution":{"observed_at":"2026-08-05T15:40:40.897972Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.882451Z","title":"three chairs,","venue":null,"work_id":"5adc27a0-edb9-473b-a861-df0af9df6877","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.557088Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:274ffff634da58c61ab60747e45e32b0dbc1bbea29f1cdb84421ba754394f754","observation_id":"2f25c3d7-ceb1-4d3f-b2cb-85be3c223669","resolution":{"observed_at":"2026-08-05T15:40:40.886292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.764483Z","title":"the lamp is on top of the desk,","venue":null,"work_id":"5e3cdc7b-5ec2-4084-9031-9992b6c1fa8c","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.560393Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:5a54211699889a603f5ed31093e3014de38f7db4bed5f7ace88ff9511dcaab5b","observation_id":"2747719c-ecce-4797-a12a-6d8f5f63f1d0","resolution":{"observed_at":"2026-08-05T15:40:40.768054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:40:40.753157Z","title":"nearby\" can be replaced with","venue":null,"work_id":"24da9b47-e395-46f2-8263-ed96091bf504","year":null},"citing_paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:40:40.564012Z"},"links":{"citing_paper":"/paper/2508.19650"},"observation_digest":"sha256:b8868fe111fa877a6978a7b869a94a85b4a09239c8487803c7ffb4b8b1b625dc","observation_id":"b2ae1e6c-6403-459c-8c95-e8b2abe56a88","resolution":{"observed_at":"2026-08-05T15:40:40.757346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19650","last_updated":"2025-08-29T02:25:23Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:41:04.074807Z","submitted_at":"2025-08-27T07:58:16Z","title":"Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 2 inbound Pith citation observations for arXiv:2508.19650."}