{"as_of":"2026-08-18T01:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c424c65f9c26409aeec9265d195c79ec345fa7001a6c5d8fd74a525aec9e8ec","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:43:43.323375Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:15:40.944411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T03:16:18.683507Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"cited_work":{"arxiv_id":"2504.19918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19918","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing surgical documentation through multimodal visual-temporal transformers and generative ai","venue":null,"work_id":"307bce19-4967-49d4-88bb-1711a5e4319e","year":2025},"citing_paper":{"arxiv_id":"2605.08712","last_updated":"2026-05-09T05:48:51Z","snapshot_observed_at":"2026-08-16T13:19:00.029881Z","submitted_at":"2026-05-09T05:48:51Z","title":"From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:15:40.944411Z"},"links":{"cited_paper":"/paper/2504.19918","citing_paper":"/paper/2605.08712"},"observation_digest":"sha256:e29c536ecd9bab62dea62c9294dc410b99032dc3f0e696851ee762ecb2254f1c","observation_id":"5758488c-4032-45a5-a1b7-4bada09099ed","resolution":{"observed_at":"2026-05-12T03:16:18.685120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19918/citation-record","integrity":"/paper/2504.19918/integrity","json":"/paper/2504.19918/citation-record.json","paper":"/paper/2504.19918"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.358704Z","title":"Gaze-assisted automatic captioning of fetal ultrasound videos using three-way multi-modal deep neural networks","venue":null,"work_id":"1d57fb97-1867-4125-ad4f-09f2dd07d470","year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:41.901887Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:94fb0a4658d9576c1f58721cc4cfea4d00124b27746c63229c34690f39d68337","observation_id":"65b91c13-a6f5-46ea-aba4-1869d9f6ba08","resolution":{"observed_at":"2026-08-16T05:43:45.444080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.045511Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.045511Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:acdaed4185f47f29c1e19924f806d6d735512e0eef1ea454ff6ecabf2d1f0e1a","observation_id":"280b488c-fd8d-487b-9ffa-85a235bc249e","resolution":{"observed_at":"2026-08-16T05:43:42.045511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.340633Z","title":"Croma: Cross-modal attention for visual question answering in robotic surgery","venue":null,"work_id":"c15324ac-47ce-4246-91ed-7649dca16875","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.094303Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:6ed10f17d791f84b711428790a926d4eca550e7a01da399e1b7ccfdfc54703d8","observation_id":"022d5a76-e071-460c-856a-0ba400f6845e","resolution":{"observed_at":"2026-08-16T05:43:45.344698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.329457Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"a76b0aa8-8f42-4a34-84da-b727840021e9","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.098989Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:b3205a2b8ee91b42814382a04a87fcd1d9caa55f07830eab93f66cb512e84e18","observation_id":"51231b20-71de-4633-97ae-83c22eb59cdd","resolution":{"observed_at":"2026-08-16T05:43:45.333637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.318013Z","title":"Video-based coaching in surgical education: a systematic review and meta-analysis","venue":null,"work_id":"25da00f6-480c-456f-81b4-7a4e1ab4fa16","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.103523Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:6a11441557ef2c5866eabe970edbab1a5ace98ba8dce0473259b40b1263edff9","observation_id":"039eefb5-dc0a-4d47-8dd1-0f44e18d48ad","resolution":{"observed_at":"2026-08-16T05:43:45.321896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-16T05:43:42.108010Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.108010Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:0e8b4bd5b4cd4c7ec2d263e4c9baa430d2256273297a735fa7fddd352ebd4b01","observation_id":"603f2386-1211-4df2-b3dd-0cd525f62106","resolution":{"observed_at":"2026-08-16T05:43:42.108010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.306892Z","title":"Space-time attention networks for video understanding","venue":null,"work_id":"68211bee-747d-462c-9b1e-4f652ef97fd6","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.112743Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:b2f91fcc533f50ee8c2fed4e649b09e809e574b68462d4c7fd7c06ed4c450d77","observation_id":"6914d4e4-bb35-4512-aaaa-0345ebd44a15","resolution":{"observed_at":"2026-08-16T05:43:45.310249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.296286Z","title":"Language models are few-shot learners","venue":null,"work_id":"97a5085b-b079-43dc-85d5-d4bff8b60250","year":1901},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.117842Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ce73644f585c1394f3e313201a23d18c3b6de00150f9ef458eadf02b3d385224","observation_id":"c6600e4a-58ef-4a81-9729-6d828ffecccb","resolution":{"observed_at":"2026-08-16T05:43:45.300076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.219918Z","title":"Cholect50: A dataset for surgical video understanding, 2020","venue":null,"work_id":"4006efcd-0c8f-4ce4-8606-ed7fa000c795","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.184774Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:780ae0ef2c585de7f0109e262ee8c15b4689448af1e2c964b7c794eb311a56a9","observation_id":"87b33889-2b43-46fe-be96-4dbfdc430a75","resolution":{"observed_at":"2026-08-16T05:43:45.288051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-024-06727-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.368783Z","title":"Unmasking deception: a topic-oriented multimodal approach to uncover false information on social media","venue":null,"work_id":"b75e7e5e-2287-43e7-a00b-2e3ef10ca1b2","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.281716Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:144ec0677f4d72fdc272ca9513772314d73f80c1e9ce24cc4a54827dc6157167","observation_id":"a32d99c5-1b30-4ab5-b1a5-ff6614355c87","resolution":{"observed_at":"2026-08-16T05:43:43.435845Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.101979Z","title":"Harnessing prompt- based large language models for disaster monitoring and automated reporting from social media feedback","venue":null,"work_id":"641bd41f-558e-4549-9a10-62182cbc9aa4","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.285629Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:301cc7be39b24d1a2b749689437a4e24191b0a5d1d375a8609ab46f104c1998b","observation_id":"06637a61-a7e7-4ab1-b454-4217e529dcd1","resolution":{"observed_at":"2026-08-16T05:43:45.145499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.075947Z","title":"Surgical video captioning with mutual-modal concept alignment","venue":null,"work_id":"e5201a15-223e-4e17-a221-f17fcbf40059","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.290474Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3cf85b51c0e4dcf035c2889d4284e707d8713f7e75e3852ed79113356e6db31c","observation_id":"39b92217-b8ee-4594-b58d-ed878c367b21","resolution":{"observed_at":"2026-08-16T05:43:45.079828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.064519Z","title":"Vision language models in medicine","venue":null,"work_id":"eea43a6e-1590-48d1-90ed-04813ea78a07","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.294015Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:5cc962bb23de5c00fca1d02d68e1cc2bfd7cb91c1821f6cdbc4e8eed3b03e24b","observation_id":"ded858a9-602a-4671-877b-82ee7d967e02","resolution":{"observed_at":"2026-08-16T05:43:45.068097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.052067Z","title":"Meshed-memory transformer for image captioning","venue":null,"work_id":"4782a597-4d6f-4dad-b608-1f00938d6400","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.297352Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:cdac7608fe323cf23d04f319f1fb00d0c774a3ab6a976ab4a57837a24d32bb17","observation_id":"93f429a1-a0c4-44f9-bfc0-ba361da86f91","resolution":{"observed_at":"2026-08-16T05:43:45.056339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.039892Z","title":"Attribution-noncommercial-sharealike 4.0 international (cc by-nc-sa 4.0)","venue":null,"work_id":"1d001f80-8ea4-4bcd-897b-0240cf349783","year":2013},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.301598Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:e2893fbd930976d82bf6c81ce7e380808615bf50b804aaddfb4d308d0a3714cc","observation_id":"d8d9dc8d-ba59-44dc-b943-e148c86a717b","resolution":{"observed_at":"2026-08-16T05:43:45.044287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.306279Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.306279Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:713bbe19cffa17d402c2bca92bf7ce847867917ae717f5cc94e7cd595fb08c90","observation_id":"56de2812-4295-4153-9b2a-c6e09463dc48","resolution":{"observed_at":"2026-08-16T05:43:42.306279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T05:43:42.310201Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.310201Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:275ed94b00462e45da21356748e271219a419c3c1f17e111acdaeeabbf768d99","observation_id":"194f44f0-0ef8-430b-aea0-ab09b47168ac","resolution":{"observed_at":"2026-08-16T05:43:42.310201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.020702Z","title":"Surgical video analysis: an emerging tool for improving surgeon performance, 2015","venue":null,"work_id":"9ec6bd10-ba2d-4423-b711-8f0fedcff042","year":2015},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.321600Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:446e406b16774047b04370a45c6c1218f9d0ddc6fd4624bb0bb5839bdffef8f5","observation_id":"621034ec-7d7a-4a42-9e82-aab2b673014d","resolution":{"observed_at":"2026-08-16T05:43:45.025018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T05:43:42.420366Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.420366Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:dd9031f321e5bdfa0f65e48e977b5f340c6e1affcaff4ce942d090dbdc9b5d69","observation_id":"f30f51f4-3509-40ea-85c8-9be32a31300a","resolution":{"observed_at":"2026-08-16T05:43:42.420366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-16T16:27:12.319907Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-16T05:43:42.424641Z","title":"Videoorion: Tokenizing object dynamics in videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.424641Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8eeee3b74382d58914b0f59261901a43282484aeffe25898498876e17d855952","observation_id":"33f7feff-207a-4e92-9c5b-053e6c498d97","resolution":{"observed_at":"2026-08-16T05:43:42.424641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:45.007603Z","title":"Image-text surgery: Efficient concept learning in image captioning by generating pseudopairs","venue":null,"work_id":"5e92d893-83cb-4791-a4f4-0ace077de77c","year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.428992Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:77cabe12a8b4f78e2304741e11573c76952e38679c7398580094439812aa45c3","observation_id":"31eb75b2-ec8e-4279-b99c-6a5079cf7248","resolution":{"observed_at":"2026-08-16T05:43:45.012197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.995229Z","title":"Using surgical video to improve technique and skill","venue":null,"work_id":"8518b560-416e-4ea2-834f-fd84a49188ac","year":2016},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.432844Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1be104f4b08e1a9e24334d2c6550428566493a1df18aeda917e7c1154ac95374","observation_id":"bc4e316c-c4f0-4553-95c9-6d6039c5bad7","resolution":{"observed_at":"2026-08-16T05:43:44.999052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.873387Z","title":"Weinberger","venue":null,"work_id":"bc6d57eb-cef9-46f9-8e11-f52abe438eaa","year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.436742Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:75b6546fab32f955bd5698cbda0b38118abcf6350be616ffe0ae56102b639686","observation_id":"76f39dcb-1c49-4e43-83c0-b8b096c61cf7","resolution":{"observed_at":"2026-08-16T05:43:44.987453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.440064Z","title":"Hashimoto, Guy Rosman, Daniela Rus, and Ozanan R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.440064Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ae702ab72de7cb445afec703d174b68eb7ba0a895a1b08f10eed7463d53e2900","observation_id":"affd8197-634a-4798-bb4c-b1d19b77990e","resolution":{"observed_at":"2026-08-16T05:43:42.440064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.443698Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.443698Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:4aca922b620afb5b46b019c783644148ed96cd23d0b00eef9c2b6172f7a88f97","observation_id":"24aa3131-0181-4d5f-a397-da3ab2eab46e","resolution":{"observed_at":"2026-08-16T05:43:42.443698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09923","last_updated":"2017-12-28T16:46:05Z","snapshot_observed_at":"2026-08-14T19:59:33.923433Z","submitted_at":"2017-12-28T16:46:05Z","title":"What do we need to build explainable AI systems for the medical domain?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09923","snapshot_observed_at":"2026-08-16T05:43:42.447190Z","title":"What do we need to build explainable ai systems for the medical domain? arXiv preprint arXiv:1712.09923, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.447190Z"},"links":{"cited_paper":"/paper/1712.09923","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:fbd76b872ad0bb74d0bc6ce444fc068d678b0ec207603cf40416350308fa01bf","observation_id":"18f0a98e-45a9-43c5-8002-ec7d69782cfb","resolution":{"observed_at":"2026-08-16T05:43:42.447190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.480347Z","title":"Advancing medical imaging with language models: featuring a spotlight on chatgpt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.480347Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:868ba7e91dc6d123f424c5f0e2e5a4fce334a6d24826da159f103f1ec32d6d6d","observation_id":"f900bf73-ce3b-4439-a8b4-329ac5725203","resolution":{"observed_at":"2026-08-16T05:43:42.480347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.755665Z","title":"Exploring video captioning techniques: A comprehensive survey on deep learning methods","venue":null,"work_id":"0f4c459c-7a1b-4fa6-bfe9-c7657d2ea76d","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.538829Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:e787630e35dd5f2ad2e6e540fe4afff3ddea892055243890e3fdb53e6156b976","observation_id":"31430eef-cd38-4ddb-84a7-3b5354f949b2","resolution":{"observed_at":"2026-08-16T05:43:44.794772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.569371Z","title":"Multi-task recurrent convolutional network with correlation loss for surgical video analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.569371Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:700b233856a4155d7f8ced68c26ca3c38775bdccf55c59b4ab344f8183475b45","observation_id":"1ab8b5de-f54d-4030-8a4f-742972c7a017","resolution":{"observed_at":"2026-08-16T05:43:42.569371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.736577Z","title":null,"venue":null,"work_id":"c7e3c3d9-2d84-490e-b7cf-703175c43b71","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.572825Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:42f6bb565d03f128755bb9ccf1d32e68ec7cefca77f75eafd6150193215af8e5","observation_id":"edeb8745-7979-49a4-9857-c02cfe1e1b2f","resolution":{"observed_at":"2026-08-16T05:43:44.740682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.724662Z","title":"Predicting decompression surgery by applying multimodal deep learning to patients’ structured and unstructured health data","venue":null,"work_id":"de77fb3e-bd0d-4ea7-be10-dd84f4bc9f21","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.576369Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:190287d3de1faf956fa69b47bf292534ecb821f3c3904e1fc6793d5557573116","observation_id":"f61e7426-f910-40f8-8c08-9a521495ec05","resolution":{"observed_at":"2026-08-16T05:43:44.728676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.713597Z","title":"Stvs: Spatio-temporal feature fusion for video summarization","venue":null,"work_id":"e5d4726a-bc9d-460f-a4e8-248995e1943f","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.580245Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f6a6b72b55be8abcec6e94491fc44b1e427e9dd6423cae645d50682616d2bcb6","observation_id":"875b45cd-286d-42fb-94fb-211e21c07b17","resolution":{"observed_at":"2026-08-16T05:43:44.717527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.702083Z","title":"Intraoperative video analysis and machine learning models will change the future of surgical training","venue":null,"work_id":"ed77b3ed-f03f-4081-928b-a4d671667c1c","year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.584521Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:1dafa3bc61cff420b47257356a2d361810e06657493eb35279955dbd11a8f5e4","observation_id":"56c5463d-1a87-45e6-92ec-1370e65ebf37","resolution":{"observed_at":"2026-08-16T05:43:44.705961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.688808Z","title":"Video question-answering techniques, benchmark datasets and evaluation metrics leveraging video captioning: A comprehensive survey","venue":null,"work_id":"b95c134b-d43c-42b2-99fa-2455cfaf075f","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.589002Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:d36ca0551da9e7b1189a8352f56aa314eef1149ae133015ba08ac51f34af22a8","observation_id":"854b319b-648e-4b96-afa4-23398b71d643","resolution":{"observed_at":"2026-08-16T05:43:44.694043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.625442Z","title":"Generating automatic surgical captions using a contrastive language-image pre-training model for nephrectomy surgery images","venue":null,"work_id":"d7fe9cae-b855-407d-916a-1af7c4655c62","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.593164Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:cf73739ce140e7b6cc48842ab4b8384e3ac182dd37c3e2b94c4a4e2b2f0ed872","observation_id":"dd7a2d58-84ae-47f6-81b5-4bbd8eb01835","resolution":{"observed_at":"2026-08-16T05:43:44.680800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.519880Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training","venue":null,"work_id":"192b5df9-176d-41cf-ba67-eaa5587b2442","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.596149Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:520c71abfff4204cda045d4a098eb95015a2b91237ade570b333763c28cfe69a","observation_id":"d1d62cd2-c2e6-484d-80b5-e3a8ae531713","resolution":{"observed_at":"2026-08-16T05:43:44.580260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.474271Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"51cd6dc5-aa84-4290-855e-acd598cab270","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.599127Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:48964342a97fd15aeed247bde65db3b6d39143eb468e35208bee65ae87f3c573","observation_id":"c909f190-b858-4177-bbd7-26a6fe8458c0","resolution":{"observed_at":"2026-08-16T05:43:44.478307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.658846Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.658846Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:6367fb5f293b544a3990788328cfdea4bf5371a42d6002d7d9ae2f99822f1a0a","observation_id":"89765e17-031a-42ed-8228-629600724cc1","resolution":{"observed_at":"2026-08-16T05:43:42.658846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.723455Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.723455Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:0c6edd371bf4794937a59ba5e4469ce6868458e23195bda798a66c4900f81be5","observation_id":"a2fe0918-af0a-4acb-a986-d5de792d3d04","resolution":{"observed_at":"2026-08-16T05:43:42.723455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.781863Z","title":"A survey on deep learning in medical image analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.781863Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:17e79f12b7f3dbab84aaa266bc957ae7c61d3dacefe07d8622b9dded0cebb76c","observation_id":"c337ad92-c209-44d3-b340-6dc6b35f3806","resolution":{"observed_at":"2026-08-16T05:43:42.781863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.443290Z","title":"Video content analysis of surgical procedures","venue":null,"work_id":"0da1123d-e868-4863-9d6f-576141c414ac","year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.785565Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c99b32ee5d3218285a47e1ee7b5adb9542d1f90288c49f1fdddec4f99c331bc3","observation_id":"43827adc-7873-4fc2-9db6-e29b2b319165","resolution":{"observed_at":"2026-08-16T05:43:44.447588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-16T11:35:16.348747Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-16T05:43:42.788616Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representa- tions for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.788616Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:2299da5289f6752068b457b1efb4ac4d520e94365aed34d0b37f170fc79f6aed","observation_id":"2f6bb367-4920-4ce2-9860-cea82207a6a0","resolution":{"observed_at":"2026-08-16T05:43:42.788616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.793034Z","title":"BioGPT: generative pre-trained transformer for biomedical text generation and mining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.793034Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3c0788975a221c6c49903b359e8744a8542a419052b56a81257e684111be69e1","observation_id":"e0c75f67-a4c2-4e39-8646-426c82a5e4cd","resolution":{"observed_at":"2026-08-16T05:43:42.793034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.431877Z","title":"Surgical data science for next- generation interventions","venue":null,"work_id":"a54c0fc5-c7f7-4692-8686-e7e06d8d5fe9","year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.796684Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3db1eb2a07c28ec9a763da31667651e687930807b7f828c62f9e3db6637f7323","observation_id":"2ccc63c2-d92e-4809-bc7b-05c429c369a7","resolution":{"observed_at":"2026-08-16T05:43:44.435637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.362829Z","title":"Is online video-based education an effective method to teach basic surgical skills to students and surgical trainees? a systematic review and meta-analysis","venue":null,"work_id":"9fc1fb94-ea42-409e-92da-ea6d5367e7e7","year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.800372Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:90e4fd0c62cfebf28f8d20870f84a7ef115f7451d1b636cd5b6aa836a1f30318","observation_id":"60222a66-fa30-4a7b-a46b-4040224b16cd","resolution":{"observed_at":"2026-08-16T05:43:44.424288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.804020Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.804020Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:03a60d3b981c1b69d607ac6949c12c993c485643d70c694b8414e8d00ca54e17","observation_id":"ebb80fc1-898e-4d06-9d57-2c6d1f0d20db","resolution":{"observed_at":"2026-08-16T05:43:42.804020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T05:43:42.807245Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.807245Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:59829e4cdd6a1d210fcc9f68861c0e59f98a2573643384b319a675709f2f53bd","observation_id":"b4b81d0e-c758-4e95-a55d-13f7aa103878","resolution":{"observed_at":"2026-08-16T05:43:42.807245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.252268Z","title":"Bleu: A method for automatic evaluation of machine translation","venue":null,"work_id":"2b0315a9-17c1-4289-ad01-62c7e0a6cae5","year":2002},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.811499Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:eb13f74dd326ac5eed5bb6c122595aad7570f13611150e141cbf88fc52aebeaa","observation_id":"5192ce61-c9ab-4f48-aa7c-97b85abee2c4","resolution":{"observed_at":"2026-08-16T05:43:44.281583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.240355Z","title":"Dense video captioning: A survey of techniques, datasets and evaluation protocols","venue":null,"work_id":"e3233ef5-d376-405a-9df0-0ad1efe1c6ba","year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.814496Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:dd59aaeb467a9cfbeebfc0deaa93db527ae403d8705e019cbb2597167fd7e823","observation_id":"6f62def6-996b-4313-afd1-14255631a386","resolution":{"observed_at":"2026-08-16T05:43:44.244441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:42.818065Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.818065Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8b91be25f989937e18805292a1020531886a4428dfbc9481dafa218d933a9a82","observation_id":"e9597801-e764-448d-8094-729d3e9a4ed6","resolution":{"observed_at":"2026-08-16T05:43:42.818065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.218864Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"392f0719-75af-40a1-aeb3-9c63453100c3","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.849230Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:d077bf66c0757ddc3ef79eb30b0adec4b7049c987c6257d2870b1626b74658fa","observation_id":"a2d14e7b-3278-431b-b548-cfa2e625cae2","resolution":{"observed_at":"2026-08-16T05:43:44.223163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.205945Z","title":"Dl4burn: Burn surgical candidacy prediction using multimodal deep learning","venue":null,"work_id":"264845db-441e-46f5-bd81-c44eaed15be9","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:42.948706Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:079142fcf6fa86c0decb0f780f2a1911bc47ba98d937bd3984cf648bb6376586","observation_id":"a8db6b68-3d6a-441d-b31f-1f5e81d6c2ea","resolution":{"observed_at":"2026-08-16T05:43:44.209756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-16T05:43:43.025376Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.025376Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:fbe13a2837b421e00d2474b2fd4b415fd76c2f14b7505c05be456d95e150bc18","observation_id":"72a4f4ca-b025-429d-ae1f-59c2dc181554","resolution":{"observed_at":"2026-08-16T05:43:43.025376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.143646Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":"f77a7091-331b-43c4-8bc8-c9a5f21cda6e","year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.101180Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f0cd9ee4ec84e07acab3431a497459d9548675546ef917f4ae47464f669640c6","observation_id":"6b1be94f-f1bf-43dc-9574-4cdb699098fb","resolution":{"observed_at":"2026-08-16T05:43:44.168239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.085835Z","title":"Evolution of visual data captioning methods, datasets, and evaluation metrics: A comprehensive survey","venue":null,"work_id":"61408972-a242-4279-a172-0b83f1e951be","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.105167Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:3be86b7d241a00e76dac192f092fdf157069bd51a3cad77ef81759c3895978fe","observation_id":"00ee135e-a59f-423f-b686-cb6bf8cc72fe","resolution":{"observed_at":"2026-08-16T05:43:44.091053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-16T14:30:19.311365Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09617","snapshot_observed_at":"2026-08-16T05:43:43.109468Z","title":"Sara Mahdavi, Joelle Barral, Dale Webster, Greg S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.109468Z"},"links":{"cited_paper":"/paper/2305.09617","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:6d4678ac323314031f9c8745981eeef77feded3c7be02a33fb34acf6d011428b","observation_id":"080d5a68-750d-4eed-8abb-1f2fa956df12","resolution":{"observed_at":"2026-08-16T05:43:43.109468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.072765Z","title":"Automated radiology report generation: A review of recent advances","venue":null,"work_id":"a59cb4b3-c8a7-4af8-b98a-f5aa66dfeaf5","year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.113530Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:8c56342272cdfd3dfbf34bd6b999ad77b97167f8f8d6c98d905956554b633307","observation_id":"b93d691c-fb74-4455-9ca1-f88d7ac64bf8","resolution":{"observed_at":"2026-08-16T05:43:44.077498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:44.060382Z","title":"The role of large language models in medical image processing: a narrative review","venue":null,"work_id":"c67afa85-e92b-4b2a-a793-5e9e2a25e618","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.116866Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:545ab21350a4d5515d7c52a23716a8c978d2252c51721be32c8d9441ae328047","observation_id":"b121b26e-e170-4c4e-8181-0ab025da6cfc","resolution":{"observed_at":"2026-08-16T05:43:44.064101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.971807Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"08c0dbcc-8fc1-4621-812e-130bebfb4f22","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.121206Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f9b0f1bbae85ed7786bd398d942c7f884a4c48ffb13cd063d3b63902ba21170c","observation_id":"5a201b1c-71ab-45af-be40-162d8b6f8ebe","resolution":{"observed_at":"2026-08-16T05:43:44.013534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.125685Z","title":"On large visual language models for medical imaging analysis: An empirical study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.125685Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:b0722f2b660e64611d32b48172ee3a1f047d3f45afc8ad95b5269b2311653bc8","observation_id":"dd672e10-d9ce-4a40-840c-77e56c8c2c97","resolution":{"observed_at":"2026-08-16T05:43:43.125685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.949870Z","title":"Attention is all you need","venue":null,"work_id":"95d609e1-0706-4df7-8aef-645198077f3b","year":2017},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.129378Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:a0da36c436b36467f83098dc81472124e93f3632fdeb0faa89f30b2c2f4c0af3","observation_id":"6d3aafef-a6f4-489c-86ec-f0c9fa1398d6","resolution":{"observed_at":"2026-08-16T05:43:43.954375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.933558Z","title":"A novel multimodal deep learning model for preoperative prediction of microvascular invasion and outcome in hepatocellular carcinoma","venue":null,"work_id":"b0df4847-2579-4f99-802d-45edc7118324","year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.133062Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:f93d8b760d811f0bd77230689640fcca2e3d22ff7dae535beb286da91f853c4e","observation_id":"35513820-fcbf-4ea4-a480-08bee0340569","resolution":{"observed_at":"2026-08-16T05:43:43.939261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11347","last_updated":"2025-03-15T02:35:48Z","snapshot_observed_at":"2026-08-15T06:37:59.261620Z","submitted_at":"2025-01-20T09:12:06Z","title":"EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11347","snapshot_observed_at":"2026-08-16T05:43:43.205100Z","title":"Endochat: Grounded multimodal large language model for endoscopic surgery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.205100Z"},"links":{"cited_paper":"/paper/2501.11347","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:5d21990922bc452962da4ca4db05c469e0403afcd7e425b1aa1c5b0358ce46cf","observation_id":"86232122-99d9-4ead-bb87-b5f9a2c435f1","resolution":{"observed_at":"2026-08-16T05:43:43.205100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-16T15:55:21.008454Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-16T05:43:43.297751Z","title":"Chatcad: Interactive computer-aided diagnosis on medical image using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.297751Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:144b334c6452f2def5dbbb24743cb7b5be79eec2e4d8a39ce7f6cb7dcf693fd3","observation_id":"0757bc3e-862d-41ab-a634-bdf0b97c9697","resolution":{"observed_at":"2026-08-16T05:43:43.297751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.821888Z","title":"Learning domain adaptation with model calibration for surgical report generation in robotic surgery","venue":null,"work_id":"6ebb58ad-d6a1-4c3b-8927-b8b4ed482668","year":2021},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.301562Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:ed2cc3d6facbd9ed7050f0a3f4863cbaf442e1751142d12f4b3aa4151b9efccd","observation_id":"3794ff53-9cc3-4163-814a-2a6337dfae74","resolution":{"observed_at":"2026-08-16T05:43:43.905987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13848","last_updated":"2023-01-31T18:46:19Z","snapshot_observed_at":"2026-08-16T15:58:44.768557Z","submitted_at":"2023-01-31T18:46:19Z","title":"Benchmarking Large Language Models for News Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13848","snapshot_observed_at":"2026-08-16T05:43:43.305442Z","title":"Benchmarking large language models on summarization tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.305442Z"},"links":{"cited_paper":"/paper/2301.13848","citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:7487b15acd8560b119867b03bc815f8721eddc2f836f16c58a68b2750c23b7a9","observation_id":"2967e3a6-3463-43d7-a1e2-9fabf322452f","resolution":{"observed_at":"2026-08-16T05:43:43.305442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.726637Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":"b7e73836-2430-425d-9a79-c07865d9c6d5","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.309955Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:11c8caeb3d854f7fd3929068221d955fb8a64d7dde475b877b73c99ecf23e9c3","observation_id":"c767ffd8-2e02-4c35-abda-429d62379f7f","resolution":{"observed_at":"2026-08-16T05:43:43.784836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.713457Z","title":"Dilated temporal relational adversarial network for generic video summarization","venue":null,"work_id":"ea3c2e73-9ec2-422f-85af-196664a6e853","year":2019},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.314461Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:666d3ae63be0a4e1cddd852ea7da023a6e9469e138de6c256b449bec0100a01e","observation_id":"2e0eda0c-4008-4bed-9363-b4aec77c412d","resolution":{"observed_at":"2026-08-16T05:43:43.717687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.700875Z","title":"Dense video captioning using graph-based sentence summarization","venue":null,"work_id":"2b9e0c07-7eb8-4c1b-8599-4a3c65c914ce","year":2020},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.317969Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:46c88adb71c8a2da994a355e2653ff54e5b6216058c6948b2d0d732924c39435","observation_id":"7f1238d6-d592-4abf-8762-97061ca11778","resolution":{"observed_at":"2026-08-16T05:43:43.704809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:43:43.661496Z","title":"Surgical activity recognition in robot-assisted radical prostatectomy using deep learning","venue":null,"work_id":"7a8580e4-7fd0-43f3-b29d-c95856c55efe","year":2018},"citing_paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T05:43:43.323375Z"},"links":{"citing_paper":"/paper/2504.19918"},"observation_digest":"sha256:c363b1976da5733b9ce553368045822e87b34b0705701c884540f6eff23c1414","observation_id":"897c983f-7c11-485f-a915-05066dc267e2","resolution":{"observed_at":"2026-08-16T05:43:43.692625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19918","last_updated":"2025-04-28T15:46:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:58:55.074024Z","submitted_at":"2025-04-28T15:46:02Z","title":"Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2504.19918."}