{"as_of":"2026-08-16T13:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7effa55f586eea0b289437559f00c67e334bf21aa56d163403d2b03a40e72ef","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:56:45.083869Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:56:44.139662Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:07:03.943418Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23121","snapshot_observed_at":"2026-08-07T12:56:44.139662Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.139662Z"},"links":{"cited_paper":"/paper/2505.23121","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:375a0f1e224e86190335abe9befdb112ca6b948bdb1c84432f35fe1fd6ba3d64","observation_id":"67dff097-a4ef-4016-8731-8c3e97a36b34","resolution":{"observed_at":"2026-08-07T12:56:44.139662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"cited_work":{"arxiv_id":"2505.23121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23121","snapshot_observed_at":"2026-07-02T15:07:03.943418Z","title":"arXiv preprint arXiv:2505.23121 (2025)","venue":null,"work_id":"fec6de43-9e0a-4f95-99ce-cd5b9f812254","year":2025},"citing_paper":{"arxiv_id":"2607.00465","last_updated":"2026-07-01T05:34:07Z","snapshot_observed_at":"2026-08-02T15:57:39.914387Z","submitted_at":"2026-07-01T05:34:07Z","title":"StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T15:04:18.880016Z"},"links":{"cited_paper":"/paper/2505.23121","citing_paper":"/paper/2607.00465"},"observation_digest":"sha256:7472e5b779adc6e233d2d450c88f3fe0a9d9c538a2e53c5d0e3171be8308b929","observation_id":"d446a591-5606-4e75-86c4-16112f074709","resolution":{"observed_at":"2026-07-02T15:07:03.944796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23121/citation-record","integrity":"/paper/2505.23121/integrity","json":"/paper/2505.23121/citation-record.json","paper":"/paper/2505.23121"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:46.208970Z","title":"To further expand the capabilities of large language models, multi-modal models are developed to in- corporate various types of input beyond text","venue":null,"work_id":"fd317930-bf07-4aab-8713-377915f984cd","year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.104608Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:eafa16d99e1d49fc91407edc2a5e884219c3e2e36bc63bbaf99fbbb28adb56ec","observation_id":"39eb7bad-7e14-4a37-b432-a3ba92efe39a","resolution":{"observed_at":"2026-08-07T12:56:46.288581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:45.979247Z","title":null,"venue":null,"work_id":"a64f62fc-f22c-4289-8350-27c04f8eb276","year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.307320Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:add925e0c72a26598b49088f4f17ea1f6dd44f2df4c204d415020c400bfc7d97","observation_id":"042632f9-227d-48b1-a99f-1d6aafaba300","resolution":{"observed_at":"2026-08-07T12:56:46.018188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:45.817928Z","title":"The first part comprises the data used for training, including multi-modal pretraining and instruction tuning","venue":null,"work_id":"79f34f66-81da-403d-8225-6a815275f5df","year":2011},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.368951Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:2e41120913c9d88d575ae3e1f75e5e6c1cea7d8d31f68b7508cc5c772134487d","observation_id":"ec812042-398a-4186-89c5-39076d662674","resolution":{"observed_at":"2026-08-07T12:56:45.915927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:46.098337Z","title":"Statistics show that dialogues in TMDialog are much longer, with more relevant questions and answers, than other datasets","venue":null,"work_id":"e8fdbb18-03bc-4bbb-9d7c-37b41a3951f7","year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.218545Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:19594f1534d615adb40614112119ef871a3c083bde17597d21260ca890f1e0b9","observation_id":"af2a5c7d-82d0-4f5d-90c7-866643a5b361","resolution":{"observed_at":"2026-08-07T12:56:46.160579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:45.646390Z","title":"Experimental Setup During the pre-training and fine-tuning phases, we execute a total of 40,000 and 10,000 training itera- tions, respectively","venue":null,"work_id":"3b24dd79-19d9-4aa2-811d-5057cf17830e","year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.464050Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:9a6600391a2ff4922f465bc53350196ec36a3fe3c43c39f58e57bb832607de03","observation_id":"59980d4c-04ee-4f79-a176-d0aaa23b871e","resolution":{"observed_at":"2026-08-07T12:56:45.670532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:45.724752Z","title":null,"venue":null,"work_id":"f4485666-42ff-442c-895a-29c3399a3a80","year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.423514Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:527919dfe9ce85bdf58c51d4275fdb07706dd4a411f29ef6c12b6d2c0f088796","observation_id":"7e6c37bc-011f-4b5b-aed4-3af9d028278f","resolution":{"observed_at":"2026-08-07T12:56:45.768378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:45.240255Z","title":"We intro- duce a method that effectively utilizes the GPT-4 API for multi-modal multi-turn dialogue data gen- erating","venue":null,"work_id":"4afe78c5-26f4-4875-9092-f66e60700d54","year":null},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.622812Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:d41d5c9371e343549b94e94f1707eabacc3ee944854277922b7fb069c384745c","observation_id":"be50690c-f9fa-400e-a3ee-2fc800bc2d10","resolution":{"observed_at":"2026-08-07T12:56:45.313019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:56:45.383998Z","title":"While we applied prompt en- gineering techniques and performed data filtering andmodification,itispossiblethatsomelow-quality dialogues remain in the resulting dataset","venue":null,"work_id":"ea27c0a5-c834-40b0-a7c2-d464d596ac11","year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.540767Z"},"links":{"citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:9779c47a9c7c9f86ab29346062486d79d3b5238c3dc934d800cd06b8e5166c7e","observation_id":"de84d191-a7c3-4199-bb90-ee50ebbc5a4f","resolution":{"observed_at":"2026-08-07T12:56:45.437717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:56:44.677381Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.677381Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:bd08aafd80b746c2335fbad10e450f08b3658497d79367256ab0dc8ac7c80d95","observation_id":"605d3b08-b56e-45ca-a171-22c35b1ff878","resolution":{"observed_at":"2026-08-07T12:56:44.677381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09402","last_updated":"2021-01-25T13:12:00Z","snapshot_observed_at":"2026-08-07T09:29:41.147848Z","submitted_at":"2020-02-21T16:37:57Z","title":"Addressing Some Limitations of Transformers with Feedback Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09402","snapshot_observed_at":"2026-08-07T12:56:44.790395Z","title":"Jiazhan Feng, Qingfeng Sun, Can Xu, Pu Zhao, Yaming Yang, Chongyang Tao, Dongyan Zhao, and Qingwei Lin","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.790395Z"},"links":{"cited_paper":"/paper/2002.09402","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:c6e0fe83aa5459d1dce6db1cdfe879a6ef50acd127117ea20a946fee9b4e4130","observation_id":"3893c571-7756-419b-a713-d39188771d29","resolution":{"observed_at":"2026-08-07T12:56:44.790395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-07T12:56:44.958460Z","title":"Kurt Shuster, Samuel Humeau, Antoine Bordes, and Jason Weston","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.958460Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:10b3876529f5953c7c8af3d8e6b27b6ed295c636eac8ca368a4c2279e6704417","observation_id":"2a2f0c2b-c766-4e57-b8e3-b7387a072e7c","resolution":{"observed_at":"2026-08-07T12:56:44.958460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-07T12:56:45.083869Z","title":"arXiv preprint arXiv:2303.11381","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:45.083869Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:41353b26a1236263621236c7bb6e1032abccd663e8e30ad89c1d66817345fd4c","observation_id":"807fbcf5-bb4d-4d4c-ae49-df28125ce891","resolution":{"observed_at":"2026-08-07T12:56:45.083869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-07T12:56:44.868908Z","title":"Jordi Pont-Tuset, Jasper Uijlings, Soravit Chang- pinyo, Radu Soricut, and Vittorio Ferrari","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.868908Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:a0603a3fea2c27eef1ae52c54e8121951253ad3053223c2a66a999f7411f07b7","observation_id":"9a3f4199-17f5-434f-bf6d-41922d510f10","resolution":{"observed_at":"2026-08-07T12:56:44.868908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-08-16T10:48:32.490692Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-07T12:56:44.719903Z","title":"Abhishek Das, Satwik Kottur, Khushi Gupta, Avi Singh, Deshraj Yadav, José MF Moura, Devi Parikh, and Dhruv Batra","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.719903Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:a20dcd1e0e0abb95296ba55d61b9f973d881a366ec3900252761b4ea5e75492c","observation_id":"9a6a28ac-9720-4e62-adf8-f5cd80f3dc34","resolution":{"observed_at":"2026-08-07T12:56:44.719903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23121","snapshot_observed_at":"2026-08-07T12:56:44.139662Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.139662Z"},"links":{"cited_paper":"/paper/2505.23121","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:375a0f1e224e86190335abe9befdb112ca6b948bdb1c84432f35fe1fd6ba3d64","observation_id":"67dff097-a4ef-4016-8731-8c3e97a36b34","resolution":{"observed_at":"2026-08-07T12:56:44.139662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-12T12:50:51.005571Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-07T12:56:44.913208Z","title":"Xiaoming Shi, Zeming Liu, Li Du, Yuxuan Wang, Hongru Wang, Yuhang Guo, Tong Ruan, Jie Xu, Xiaofan Zhang, and Shaoting Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:44.913208Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2505.23121"},"observation_digest":"sha256:a39ca1ec3be66a74fb1635cf5df8d0440cf051ee6c4fc8d081b9f317957e7df4","observation_id":"b97d02d6-97ab-4242-a303-e1dcd79285c4","resolution":{"observed_at":"2026-08-07T12:56:44.913208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23121","last_updated":"2025-07-17T16:49:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T02:41:00.005141Z","submitted_at":"2025-05-29T05:41:26Z","title":"ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 2 inbound Pith citation observations for arXiv:2505.23121."}