{"as_of":"2026-08-23T07:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b23c47751092f4632945c49c49707017e273f32e8d2cb71dee4a864b1f3ab288","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:22:46.580769Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T23:18:59.283834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T23:24:01.706149Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"cited_work":{"arxiv_id":"2510.15859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.15859","snapshot_observed_at":"2026-06-29T23:24:01.706149Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","venue":"cs.CL","work_id":"5459e077-5728-47f5-921d-684ba8383826","year":2025},"citing_paper":{"arxiv_id":"2605.25273","last_updated":"2026-05-24T21:59:32Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-24T21:59:32Z","title":"LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-06-29T23:18:59.283834Z"},"links":{"cited_paper":"/paper/2510.15859","citing_paper":"/paper/2605.25273"},"observation_digest":"sha256:3449e30bebffcbbef0ae8920d6e229262aac4ae0e19a6692b3a25c058dde7adf","observation_id":"372bc0a3-133d-40e8-a4f9-58acde27eaf9","resolution":{"observed_at":"2026-06-29T23:24:01.707495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.15859/citation-record","integrity":"/paper/2510.15859/integrity","json":"/paper/2510.15859/citation-record.json","paper":"/paper/2510.15859"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T09:22:40.110994Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:40.110994Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:7d4fd887eed0dbb8aa61354fe340acd86d1cca59a8aebda1c8e1ed90fe15efc2","observation_id":"a34295d0-34fb-43cc-be62-9b00871745fe","resolution":{"observed_at":"2026-08-04T09:22:40.110994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:40.930592Z","title":"Language models that think, chat better.arXiv preprint arXiv:2509.20357,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:40.930592Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:29d084d3dd605bf5fe118d6f2e6a6c5c93e30ffd4107e33616225761bcf4b78e","observation_id":"51d06983-6196-491a-a143-7cccab947567","resolution":{"observed_at":"2026-08-04T09:22:40.930592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:41.760730Z","title":"Ace-rl: Adaptive constraint-enhanced reward for long-form generation re- inforcement learning.arXiv preprint arXiv:2509.04903,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:41.760730Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:06dda60efe48ea9867a409e4e719cdad463c0bc54a9371b26015fb39118a5b98","observation_id":"5276c8a0-776e-41c3-b934-af35ee4e937e","resolution":{"observed_at":"2026-08-04T09:22:41.760730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-04T09:22:41.903752Z","title":"Huatuogpt-o1, towards medical complex reasoning with llms.arXiv preprint arXiv:2412.18925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:41.903752Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:31af03db7f4ea726d380fd7db53fd8e63b53a263f782070f2f65a6e23b04673a","observation_id":"63376715-0001-4f25-9e4d-3cea55bbc407","resolution":{"observed_at":"2026-08-04T09:22:41.903752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-04T09:22:42.012260Z","title":"Sft memorizes, rl generalizes: A com- parative study of foundation model post-training.arXiv preprint arXiv:2501.17161,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.012260Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:6581333593e756c9f17a38ef84fade7d29b5cf00de21da7267637c5bdde80d64","observation_id":"a388ea47-140f-42eb-bebb-9b2e25ba3a5f","resolution":{"observed_at":"2026-08-04T09:22:42.012260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T09:22:42.136987Z","title":"Gem- ini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.136987Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:ddaf814e3c16604703efc330dd31752486b200719ad8df21dcdbb672f97e1d19","observation_id":"71bb4fec-3170-44f5-859f-ac3bc0284b3a","resolution":{"observed_at":"2026-08-04T09:22:42.136987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-04T09:22:42.290521Z","title":"Ultrafeedback: Boosting lan- guage models with scaled ai feedback.arXiv preprint arXiv:2310.01377,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.290521Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:07627db9da95e529ff9bef070573046b4331c3b3c430158a483dce2c4214ee9e","observation_id":"60b940e9-440d-40ff-9dc9-27b582546b88","resolution":{"observed_at":"2026-08-04T09:22:42.290521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:42.370031Z","title":"Multichallenge: A realistic multi-turn con- versation evaluation benchmark challenging to frontier llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.370031Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:2620bcdd06786f5a44fcaa17446692910ec0ecc43b521da6cd1c5e1c2f74615c","observation_id":"dd3fcd13-dbfe-47c0-a4ad-eea3a1adb75f","resolution":{"observed_at":"2026-08-04T09:22:42.370031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:42.457913Z","title":"Qa-lign: Aligning llms through constitution- ally decomposed qa.arXiv preprint arXiv:2506.08123,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.457913Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:2bfb4aa85d2ff58c25f021b59506a7ddd923734cb3d93f637dc074ba4e9155b1","observation_id":"c49ab613-422c-446f-ae97-617e899e3be1","resolution":{"observed_at":"2026-08-04T09:22:42.457913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-17T11:13:51.858687Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02208","snapshot_observed_at":"2026-08-04T09:22:42.521571Z","title":"Baichuan-m2: Scaling medi- cal capability with large verifier system.arXiv preprint arXiv:2509.02208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.521571Z"},"links":{"cited_paper":"/paper/2509.02208","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:42a3fa6e9b3785400f86e293f16e3c16c7a467bf0e367068583b678ef9d9d965","observation_id":"294d778f-1817-420d-8322-4c8adf78cb60","resolution":{"observed_at":"2026-08-04T09:22:42.521571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-04T09:22:42.681512Z","title":"Rubrics as rewards: Re- inforcement learning beyond verifiable domains.arXiv preprint arXiv:2507.17746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.681512Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:c553f1f694b585d7bb98702bf8fb8514331fc4539d9b0bd3341e341272eb93c6","observation_id":"2b9a9b21-0407-4aae-9415-86805e856077","resolution":{"observed_at":"2026-08-04T09:22:42.681512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:42.737007Z","title":"m1: Unleash the potential of test-time scaling for medical reasoning with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.737007Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:6b1d386b2452461e3378c516f8b90122eed5269f4cd13f72326ea9cffd768c52","observation_id":"a5406e69-7612-4621-ac78-c534ba31f751","resolution":{"observed_at":"2026-08-04T09:22:42.737007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-08-13T02:26:26.115035Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.14234","snapshot_observed_at":"2026-08-04T09:22:42.829865Z","title":"Compute as teacher: Turning inference compute into reference-free supervision.arXiv preprint arXiv:2509.14234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.829865Z"},"links":{"cited_paper":"/paper/2509.14234","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:2479eb0f6d8bbe4181d2bacb72e4cbf6a805ed7afb7d2a57dbf8e2a309b25efe","observation_id":"793ac8f9-4666-4d31-bcaf-393bc9335441","resolution":{"observed_at":"2026-08-04T09:22:42.829865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-18T08:56:17.187633Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T09:22:42.928860Z","title":"Reward design with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.928860Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:333c5544a0340939b71631ff7d8b43784d60982cc9d08b1f8432ca2ead9a620f","observation_id":"587ece49-1ab1-4654-ac28-0f2667bb4dd4","resolution":{"observed_at":"2026-08-04T09:22:42.928860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02957","last_updated":"2025-01-17T11:59:23Z","snapshot_observed_at":"2026-08-20T06:25:57.728397Z","submitted_at":"2024-05-05T14:53:51Z","title":"Agent Hospital: A Simulacrum of Hospital with Evolvable Medical Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02957","snapshot_observed_at":"2026-08-04T09:22:42.993723Z","title":"Agent hospital: A simulacrum of hospital with evolvable medical agents.arXiv preprint arXiv:2405.02957,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.993723Z"},"links":{"cited_paper":"/paper/2405.02957","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:8cd8dc4f2b342c199a7a468b20b375f920f7e58bbea04f1a08cee98d6261b5a3","observation_id":"f751fc81-a66f-4fa7-8f16-a766a6380e8e","resolution":{"observed_at":"2026-08-04T09:22:42.993723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-16T13:45:13.487794Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-04T09:22:43.139966Z","title":"Wild- bench: Benchmarking llms with challenging tasks from real users in the wild.arXiv preprint arXiv:2406.04770,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.139966Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:223dc4d50213b3cdc836f494ecc23354d4089ecee0ff6319ba4b1d1a1e8cfacf","observation_id":"fca7aa40-b80c-4670-830c-3d39af3f28e3","resolution":{"observed_at":"2026-08-04T09:22:43.139966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17952","last_updated":"2025-05-23T14:27:37Z","snapshot_observed_at":"2026-08-23T05:50:39.911254Z","submitted_at":"2025-05-23T14:27:37Z","title":"Beyond Distillation: Pushing the Limits of Medical LLM Reasoning with Minimalist Rule-Based RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17952","snapshot_observed_at":"2026-08-04T09:22:43.249504Z","title":"Beyond distillation: Pushing the limits of medical llm reasoning with minimalist rule-based rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.249504Z"},"links":{"cited_paper":"/paper/2505.17952","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:a07016ff31a28c86e14c9dc2d82258581fdebbdcf9cb0a0be50cb85ad66cd846","observation_id":"4744b8c1-bbb1-4855-a935-21941b67f116","resolution":{"observed_at":"2026-08-04T09:22:43.249504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-04T09:22:43.509662Z","title":"Large language models: A survey.arXiv preprint arXiv:2402.06196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.509662Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:c3eb33749fc492dfd6fbdfd34617f6d891c80f24e7d844c50b4574f3e37094c0","observation_id":"ff6b3a35-f140-4610-ab3a-9d208e1706cc","resolution":{"observed_at":"2026-08-04T09:22:43.509662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03601","last_updated":"2024-01-07T23:01:56Z","snapshot_observed_at":"2026-08-21T00:10:56.440464Z","submitted_at":"2024-01-07T23:01:56Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03601","snapshot_observed_at":"2026-08-04T09:22:43.631107Z","title":"Infobench: Evaluating instruc- tion following ability in large language models.arXiv preprint arXiv:2401.03601,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.631107Z"},"links":{"cited_paper":"/paper/2401.03601","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:c3d689dbfc733f9b8197a114f7cd626207c2a8b1f0892f2df5ed138c154e7779","observation_id":"1af21bce-07ba-4364-b4ea-b1fbbe0452e2","resolution":{"observed_at":"2026-08-04T09:22:43.631107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T09:22:43.796312Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.796312Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:6ba01e7af8386a20140e76a5011bfd2d0e3c9dfe8750e6e689df52cc806b456d","observation_id":"38d1f916-1045-44e5-8421-baec885ace3b","resolution":{"observed_at":"2026-08-04T09:22:43.796312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-16T22:58:22.322439Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-08-04T09:22:43.958435Z","title":"Rl’s razor: Why online reinforcement learning forgets less.arXiv preprint arXiv:2509.04259,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.958435Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:fec616a8a787d808fe84ff25898046fa481a82b589121f248f3c28a0d172a518","observation_id":"b2ac91dd-c48d-493a-82c6-34ae2609fbbf","resolution":{"observed_at":"2026-08-04T09:22:43.958435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-04T09:22:44.150906Z","title":"Paperbench: Evaluating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.150906Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:f261d077327db9a259e202ac9fb7468cdc2b7dc6ec4e88a912bfc94738b2eed6","observation_id":"96fb2987-9169-495a-9dff-6ae253a63d3b","resolution":{"observed_at":"2026-08-04T09:22:44.150906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:44.258716Z","title":"Reasonmed: A 370k multi-agent gen- erated dataset for advancing medical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.258716Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:ccb4628bd668a4c8571f03ba4669f340fe45697827233ebb675d2cd4bcc68458","observation_id":"2eb2586a-26f0-400b-9932-9c66dff9cdbf","resolution":{"observed_at":"2026-08-04T09:22:44.258716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:44.414968Z","title":"Medagents: Large language models as collab- orators for zero-shot medical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.414968Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:3852ae788e40a41c3b37cf079e323f829267c0116e18b859b1573dbd5f7b77fb","observation_id":"aa0317e5-b0e1-45ca-ace3-98938490fd10","resolution":{"observed_at":"2026-08-04T09:22:44.414968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:44.556266Z","title":"Large language models in medicine","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.556266Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:ee610e7e3da0721f06b4fd467803e07b038a2ff1883595527f5026ea78b0e34d","observation_id":"80bf72b1-c7a5-4bf5-98d8-26b69633403a","resolution":{"observed_at":"2026-08-04T09:22:44.556266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T09:22:44.781689Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.781689Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:b3df6fb1850b09f3d19510660068242644eb69b6ec1969013b8a233685edc076","observation_id":"741df60c-8317-4065-983d-3d5ed13632cc","resolution":{"observed_at":"2026-08-04T09:22:44.781689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:44.929913Z","title":"Check- lists are better than reward models for aligning language models.arXiv preprint arXiv:2507.18624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.929913Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:09727e8d3935a39379bfb7eaaae78a2c85408356e1fa72b76980143f5181cfeb","observation_id":"678fc548-cf3e-4a30-9635-aa752f0a62c4","resolution":{"observed_at":"2026-08-04T09:22:44.929913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00993","last_updated":"2025-04-04T18:29:18Z","snapshot_observed_at":"2026-08-19T21:06:08.126929Z","submitted_at":"2025-04-01T17:31:44Z","title":"MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00993","snapshot_observed_at":"2026-08-04T09:22:45.109601Z","title":"Medreason: Eliciting factual medical reasoning steps in llms via knowledge graphs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:45.109601Z"},"links":{"cited_paper":"/paper/2504.00993","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:149c99645d436a87047e4deb8b3b7739d7ddbb1b1c2866371b9822c5d133580f","observation_id":"a1870351-44ba-4f14-a312-fa747656f6df","resolution":{"observed_at":"2026-08-04T09:22:45.109601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T09:22:45.350657Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:45.350657Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:c24df1f090e7dd0e23567740e70887f52d103220cf85341cfafdd27d2fb4e632","observation_id":"802c15a0-7022-4caa-a725-9cef68be0c0c","resolution":{"observed_at":"2026-08-04T09:22:45.350657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T09:22:45.579042Z","title":"Dapo: An open-source llm re- inforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:45.579042Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:df7eef8509837ffab4b2ee529564694db133bc59d18f1d061f6353c21e88e0cc","observation_id":"26268332-ed02-44b4-a5b1-ce3c2620eeac","resolution":{"observed_at":"2026-08-04T09:22:45.579042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-20T02:29:37.867282Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-04T09:22:45.779908Z","title":"Qwen3 embedding: Ad- vancing text embedding and reranking through foundation models.arXiv preprint arXiv:2506.05176,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:45.779908Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:5cb6353e627875b83c922dc7e18a714706e6a6576f9d04f6c3a4b3f2b90c80cb","observation_id":"836e7d2c-8598-4d25-af18-27d1615279d0","resolution":{"observed_at":"2026-08-04T09:22:45.779908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-04T09:22:45.967654Z","title":"Group sequence policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:45.967654Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:cee99929351ee15aeab6188430ac5057486d93fa2f43669e2d47b28b395908aa","observation_id":"20a10f86-11cb-404d-a60b-1361d6a94a3e","resolution":{"observed_at":"2026-08-04T09:22:45.967654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:46.126866Z","title":"Ask patients with patience: Enabling llms for human-centric medical dialogue with grounded reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:46.126866Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:544de8d63388d142545d2a4f7721e87bedb10a97aa9cd19ecec733cffec60764","observation_id":"fc648d4f-9614-4142-a76f-279483902ed3","resolution":{"observed_at":"2026-08-04T09:22:46.126866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:46.265245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:46.265245Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:a1341dc59cd3733b02e918918c61669851a00efed9566f951faad6d9c1601551","observation_id":"2802811a-1746-40bb-a8e7-eff22721f8c9","resolution":{"observed_at":"2026-08-04T09:22:46.265245Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:46.416690Z","title":"This subplot measures the proportion of rubrics that are satisfied (or penalties avoided) at least once within 40 rollouts for each query","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:46.416690Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:b6b8e59f690d9c7cf3dbec26cb542842d8b772b663d33ff6908a1b877d359b1a","observation_id":"2e897e7e-7f88-4ebb-a878-fa4b0e154b2e","resolution":{"observed_at":"2026-08-04T09:22:46.416690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:46.580769Z","title":"For all other models, the generation parameters were set to align with those specified in the official HealthBench protocol","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:46.580769Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:73b56954127870663d48199bf48f13a6da1fbe242a27f73510153f4a9d05f75c","observation_id":"e83c4e79-9d64-455c-945c-dd0649c27e0b","resolution":{"observed_at":"2026-08-04T09:22:46.580769Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:22:43.377717Z","title":"A generalist medical language model for disease diagnosis assistance.Nature medicine, 31(3):932–942, 2025e","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:43.377717Z"},"links":{"citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:6ff83b514025dfa87d40e97553f10ea820558636462da28933aabcbee22a16b7","observation_id":"f4c0393d-1008-4caa-8887-5e2d3577686c","resolution":{"observed_at":"2026-08-04T09:22:43.377717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-04T09:22:40.275971Z","title":"gpt-oss-120b & gpt- oss-20b model card.arXiv preprint arXiv:2508.10925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:40.275971Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:b2d0e681e04740747f0c854be87c52dc34d344f2e9b5bb518a922e81211ab7cd","observation_id":"569f998a-5475-4431-8715-ae8ea0b8a4b4","resolution":{"observed_at":"2026-08-04T09:22:40.275971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19630","last_updated":"2026-04-30T13:41:50Z","snapshot_observed_at":"2026-08-16T11:52:54.520430Z","submitted_at":"2025-05-26T07:48:14Z","title":"Real-World Doctor Agent with Proactive Consultation through Multi-Agent Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19630","snapshot_observed_at":"2026-08-04T09:22:42.597472Z","title":"Doctoragent-rl: A multi-agent collaborative reinforce- ment learning system for multi-turn clinical dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.597472Z"},"links":{"cited_paper":"/paper/2505.19630","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:8ba44632476e5f7df25ec82c16312aba0c911b26e442dc5f711abbc0de05aa7b","observation_id":"283ec89e-9879-4524-8c41-9972e0ec7745","resolution":{"observed_at":"2026-08-04T09:22:42.597472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-04T09:22:40.462108Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:40.462108Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:781fc3a70a4a7c2f92124e16807eb62cb8a4efe9dc642e3e097fdec1b2c47a27","observation_id":"453fc6cf-e046-4366-a789-5159e2506e8c","resolution":{"observed_at":"2026-08-04T09:22:40.462108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T21:11:53.391798Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2510.15859."}